La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
EmbeddingGemma 2, modèle d'embedding multimodal de 740 millions de paramètres sous licence Apache 2.0, est disponible pour le déploiement local. L’éditeur revendique des performances de pointe sous le milliard de paramètres et annonce une consommation mémoire d'environ 191 Mo en texte seul et 567 Mo en complet sur Pixel 11 Pro.
Intégrations, démos et outils déjà disponibles
Les poids du modèle sont accessibles sur Hugging Face et Kaggle, avec une disponibilité annoncée comme à venir dans Gemini Enterprise Agent Platform Model Garden. La communauté LiteRT sur Hugging Face propose des variantes optimisées pour l’appareil. Pour le développement, Google AI Edge MediaPipe prend en charge des tâches prêtes à l’emploi d’embedding, de récupération et de décision, tandis que LiteRT vise l’intégration de modèles personnalisés. Côté web, l’exécution est possible avec transformers.js ou WebGPU. Le modèle peut être servi avec des outils comme transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio, et les vecteurs peuvent être stockés avec Qdrant. Des conseils d’Unsloth pour l’affinage, ainsi qu’un guide développeurs, une documentation et des guides d’inférence et d’affinage sont proposés. Des démonstrations publiques existent dans Google AI Edge Gallery, notamment la recherche instantanée de médias et Video Moments Finder, ainsi qu’une application AI Edge Foresight.
Ressources locales et fenêtre de contexte élargie
Le modèle est annoncé comme optimisé pour des contraintes strictes sur appareil. Après quantification, la mémoire vive utilisée sur un Google Pixel 11 Pro s’élève à environ 191 Mo pour les poids du texte et à environ 567 Mo pour la version multimodale complète. La fenêtre de contexte propose désormais 8K tokens, soit un quadruplement par rapport à la génération précédente, ce qui permet de gérer jusqu’à 5,5 minutes d’audio, 29 images, 58 images vidéo ou des assemblages locaux de ces éléments. La structure modulaire du modèle donne la possibilité de recourir à seulement 270 millions de paramètres pour le texte, tandis que des encodeurs optionnels de 170 millions sont prévus pour la vision et de 300 millions pour l’audio. Pour le stockage, l’approche Matryoshka autorise la troncature de 768 dimensions vers 512, 256 ou 128, avec une réduction de stockage annoncée jusqu’à six fois.
Scores revendiqués sur MTEB Code et MAEB
L’éditeur affirme que le modèle atteint des scores de tête parmi les modèles de moins d’un milliard de paramètres sur des benchmarks tels que MTEB Code et MAEB, tout en égalant ou dépassant des systèmes plus grands sur des tâches texte, vision et audio. Sur le code, le gain annoncé est de 9,92 points dans MTEB Code, de 68,76 à 78,68, tout en conservant la performance textuelle multilingue de la génération précédente. Dans les domaines image, vidéo, documents et audio, l’éditeur présente le modèle comme établissant une nouvelle norme de qualité par paramètre sous le milliard et dépassant certains modèles spécialisés plus de deux fois plus grands. L’ensemble est décrit comme le plus performant pour des embeddings multimodaux sur appareil.
Socle technique, licence et périmètre multimodal
Le modèle s’appuie sur l’architecture Gemma 4, totalise 740 millions de paramètres et est distribué sous licence Apache 2.0 permissive à visée commerciale. Il partage avec Gemma 4 le tokenizer de texte et l’encodeur audio, les deux pouvant être exécutés ensemble dans un pipeline unifié annoncé avec une empreinte mémoire combinée réduite. L’espace d’embedding couvre nativement texte, images, audio et vidéo, avec un positionnement présenté comme optimal pour l’inférence sur appareil. La première génération, lancée l’année précédente pour les embeddings textuels, a suscité un fort usage selon l’éditeur, avec plus de 20 millions de téléchargements, des usages en recherche sur appareil et des pipelines RAG axés sur la confidentialité.
Usages sur appareil, recherche croisée et RAG
Le modèle apporte des capacités localement sur le matériel de périphérie. Selon l’éditeur, produire les embeddings sur l’appareil aide à préserver la confidentialité, réduit la latence et rend possibles des recherches et récupérations croisées hors ligne. Associé à des modèles génératifs comme Gemma 4, il est donné comme habilitant des pipelines RAG sur appareil capables d’englober des données multimodales complexes. Parmi les cas d’usage décrits figurent la recherche par similarité sémantique dans une bibliothèque multimédia depuis un texte ou une image, la localisation de moments précis dans une vidéo à partir d’une requête textuelle ou audio, et la combinaison avec Gemma 4 pour la récupération locale et le raisonnement contextuel. L’éditeur cite aussi des exemples comme la recherche d’un clip vidéo à partir d’un mémo vocal, ou des requêtes texte sur des enregistrements audio, effectués par un seul modèle multimodal.






