
Le fait
Le 6 octobre 2026, Google DeepMind lance EmbeddingGemma 2, successeur d’EmbeddingGemma (plus de 20 millions de téléchargements). Construit sur l’architecture Gemma 4 et publié sous licence Apache 2.0, ce modèle de 740 millions de paramètres place texte, code, images, audio et vidéo dans un même espace de représentation (embeddings), ce qui permet par exemple de retrouver un extrait vidéo à partir d’un mémo vocal.
Les caractéristiques clés
- Modulaire : 270 millions de paramètres suffisent pour le texte seul ; les encodeurs vision (170 M) et audio (300 M) sont optionnels.
- Économe en stockage : les vecteurs peuvent être réduits de 768 à 512, 256 ou 128 dimensions, soit jusqu’à 6 fois moins de stockage.
- Sur appareil : une fois quantifié, il demande environ 191 Mo de RAM en mode texte et 567 Mo en multimodal sur un Pixel 11 Pro.
- Contexte de 8 000 tokens, quatre fois plus que la première version : jusqu’à 5,5 minutes d’audio, 29 images ou 58 images vidéo.
- Code : le score MTEB Code passe de 68,76 à 78,68, utile pour indexer un dépôt localement.
Les poids sont disponibles sur Hugging Face et Kaggle, avec une prise en charge annoncée par transformers, sentence-transformers, llama.cpp, Ollama, vLLM, MLX et Qdrant.
Pourquoi ça compte
Les embeddings sont le moteur de la recherche sémantique et du RAG (recherche documentaire augmentée). Les produire localement évite d’envoyer ses documents à un service externe et réduit la latence.
Lecture Neurone21
C’est une brique très concrète pour l’IA locale en entreprise : un moteur de recherche interne sur des documents, des enregistrements de réunion ou du code, qui tourne sur un poste ou un petit serveur sans quitter le réseau. Les résultats publiés sont ceux de Google ; à tester sur ses propres données, en français, avant de remplacer une solution existante.