EmbeddingGemma 2 réduit le coût des recherches multimodales locales

Google DeepMind a dévoilé EmbeddingGemma 2, un modèle ouvert de 740 millions de paramètres pour texte, image, vidéo, audio et code. Pensé pour tourner sur matériel grand public, il promet des recherches locales plus rapides et des bases vectorielles plus compactes.

Google DeepMind a présenté EmbeddingGemma 2 le 6 octobre 2026, un modèle ouvert de 740 millions de paramètres qui convertit texte, code, image, vidéo et audio en vecteurs communs. Pensé pour fonctionner sur matériel grand public, il vise surtout les usages de recherche locale, de RAG privé et de classement multimodal, sans passage obligé par un serveur distant. Le sujet compte parce qu’il rapproche des fonctions jadis lourdes à déployer d’un usage plus simple, plus discret et moins coûteux.

Un seul espace vectoriel pour plusieurs médias

EmbeddingGemma 2 repose sur l’architecture Gemma 4 et projette toutes ses entrées dans un espace de 768 dimensions. Google détaille une structure modulaire : 270 millions de paramètres pour le texte et le code, 170 millions pour la vision et 300 millions pour l’audio, avec la possibilité de charger seulement la partie utile selon le cas d’usage. En pratique, cela permet de garder un même checkpoint tout en activant un sous-ensemble de capacités, ce qui limite la charge mémoire. C’est le genre de compromis que les équipes produit aiment bien, car il évite de faire appel à une grue pour déplacer une plante verte.

Le modèle accepte des entrées intercalées et partage une fenêtre de contexte de 8 192 jetons pour toutes les modalités. Google indique ainsi qu’un seul prompt peut contenir jusqu’à 29 images, 58 images vidéo ou 5,5 minutes d’audio, avec des marqueurs de position pour chaque média. La firme présente aussi EmbeddingGemma 2 comme son modèle multimodal d’embeddings le plus capable pour l’exécution sur l’appareil.

Ce que les benchmarks montrent vraiment

Sur les mesures publiées, Google dit que le modèle conserve la performance multilingue de son prédécesseur tout en améliorant son score MTEB Code de 68,76 à 78,68, soit +9,92 points. Les résultats listés par la société donnent aussi 61,36 sur MTEB multilingual v2, 64,64 sur MIEB lite, 57,28 sur MMEB v2 image retrieval, 67,84 sur visual-document retrieval, 50,67 sur video retrieval, 69,54 sur MSEB sound retrieval et 49,39 sur MAEB audio tasks. Google affirme qu’EmbeddingGemma 2 dépasse certains modèles spécialisés deux fois plus gros, [à vérifier] en l’absence de comparaison indépendante dans les sources fournies.

La vraie nouveauté pratique tient aussi à la compression des vecteurs. Grâce à Matryoshka Representation Learning, les développeurs peuvent réduire la sortie native de 768 dimensions à 512, 256 ou 128 dimensions, avec une baisse de stockage annoncée jusqu’à six fois. Le guide développeur indique qu’à 256 dimensions, la qualité reste proche de 95 % sur la recherche d’image, de vidéo et de parole, tandis que 128 dimensions conserve environ 90 % sur texte et code mais tombe autour de 75 % sur le multimodal. Autrement dit, plus le cas d’usage est simple, plus le modèle se laisse alléger sans trop protester.

Pourquoi Google insiste sur l’exécution locale

Google met en avant des temps de réponse d’environ 20 à 70 millisecondes via WebGPU dans le navigateur, ainsi qu’une consommation mémoire d’environ 191 Mo pour les poids texte seuls sur un Pixel 11 Pro, contre environ 567 Mo pour la version multimodale complète, selon ses chiffres. Le modèle peut être utilisé avec transformers, sentence-transformers 6.1.0 ou plus, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio. Des versions optimisées pour l’appareil sont aussi proposées via LiteRT Community sur Hugging Face.

Cette orientation locale a une conséquence directe pour les équipes qui construisent des assistants, des moteurs de recherche internes ou des applications de classement documentaire : moins de données quittent le terminal, et la facture d’inférence peut baisser. Google cite aussi des usages comme la recherche d’un extrait vidéo à partir d’un mémo vocal ou l’interrogation d’heures d’enregistrements audio avec une requête textuelle. Les démonstrations mentionnées incluent Instant Media Search et Video Moments Finder dans l’application Google AI Edge Gallery, ainsi qu’un usage conjoint avec Gemma 4 dans AI Edge Foresight pour retrouver des fichiers localement puis en extraire le sens.

Ouverture, mais pas blanc-seing

Le modèle est publié sous licence Apache 2.0 et ses poids sont disponibles sur Hugging Face et Kaggle. Google précise néanmoins qu’EmbeddingGemma 2 n’a pas fait l’objet d’un post-training d’alignement ni d’une modération au niveau des sorties ; la mitigation se concentre sur le filtrage des données d’entraînement, qui incluent du texte web en plus de 140 langues, du code, des images, de la vidéo et de l’audio, avec une coupure à janvier 2025. Les usages restent soumis à la Gemma Prohibited Use Policy et l’éditeur renvoie aux développeurs la responsabilité des garde-fous applicatifs.

Le modèle carte signale aussi plusieurs limites techniques : performances inégales selon les langues, précision réduite si l’on omet les préfixes d’instruction recommandés, et besoin d’éviter float16 au profit du bfloat16 ou du float32 à cause d’un risque de valeurs NaN ou d’embeddings dégradés. C’est le revers classique des modèles compacts et polyvalents : ils font beaucoup, mais pas tout, et surtout pas sans discipline de déploiement. Google précise enfin que l’arrivée dans Gemini Enterprise Agent Platform Model Garden est prévue prochainement.

Points clés

  • 6 octobre 2026 : lancement d’EmbeddingGemma 2 par Google DeepMind.
  • 740 millions de paramètres pour texte, image, vidéo, audio et code.
  • 78,68 sur MTEB Code, contre 68,76 pour EmbeddingGemma.
  • 191 Mo de RAM active en version texte sur Pixel 11 Pro.
  • Google, Hugging Face et Kaggle distribuent les poids du modèle.

En chiffres

  • 768 dimensions — espace vectoriel natif, selon Google DeepMind, 2026.
  • 8 192 jetons — fenêtre de contexte partagée entre toutes les modalités.
  • 6 fois — baisse maximale annoncée du stockage des vecteurs.
  • 20 à 70 millisecondes — latence annoncée via WebGPU dans le navigateur.
  • Plus de 140 langues — données web utilisées pour l’entraînement.

À lire