Brief IA : EmbeddingGemma 2 : embeddings multimodaux sur appareil

EmbeddingGemma 2 : embeddings multimodaux sur appareil

Brief IA
Tom Levy·4 min·1 vues

EmbeddingGemma 2, modèle d'embedding multimodal de 740 millions de paramètres, est disponible sur Hugging Face et Kaggle Le modèle est annoncé comme optimisé pour l'exécution locale, avec une empreinte mémoire de 191 Mo (texte) à 567 Mo (multimodal) sur Pixel 11 Pro Scores revendiqués en tête sur MTEB Code et MAEB, avec une fenêtre de contexte de 8K tokens et des options modulaires.

⚡
En bref
1EmbeddingGemma 2, modèle d'embedding multimodal de 740 millions de paramètres, est disponible sur Hugging Face et Kaggle
2Le modèle est annoncé comme optimisé pour l'exécution locale, avec une empreinte mémoire de 191 Mo (texte) à 567 Mo (multimodal) sur Pixel 11 Pro
3Scores revendiqués en tête sur MTEB Code et MAEB, avec une fenêtre de contexte de 8K tokens et des options modulaires
4Des démonstrations publiques et de nombreux outils de déploiement sont déjà proposés
💡Pourquoi c'est important — EmbeddingGemma 2 vise à faciliter la recherche et la récupération multimodales sur appareil, en combinant performance, modularité et confidentialité.
⚡Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

EmbeddingGemma 2, modèle d'embedding multimodal de 740 millions de paramètres sous licence Apache 2.0, est disponible pour le déploiement local. L’éditeur revendique des performances de pointe sous le milliard de paramètres et annonce une consommation mémoire d'environ 191 Mo en texte seul et 567 Mo en complet sur Pixel 11 Pro.

Intégrations, démos et outils déjà disponibles

Les poids du modèle sont accessibles sur Hugging Face et Kaggle, avec une disponibilité annoncée comme à venir dans Gemini Enterprise Agent Platform Model Garden. La communauté LiteRT sur Hugging Face propose des variantes optimisées pour l’appareil. Pour le développement, Google AI Edge MediaPipe prend en charge des tâches prêtes à l’emploi d’embedding, de récupération et de décision, tandis que LiteRT vise l’intégration de modèles personnalisés. Côté web, l’exécution est possible avec transformers.js ou WebGPU. Le modèle peut être servi avec des outils comme transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio, et les vecteurs peuvent être stockés avec Qdrant. Des conseils d’Unsloth pour l’affinage, ainsi qu’un guide développeurs, une documentation et des guides d’inférence et d’affinage sont proposés. Des démonstrations publiques existent dans Google AI Edge Gallery, notamment la recherche instantanée de médias et Video Moments Finder, ainsi qu’une application AI Edge Foresight.

Ressources locales et fenêtre de contexte élargie

Le modèle est annoncé comme optimisé pour des contraintes strictes sur appareil. Après quantification, la mémoire vive utilisée sur un Google Pixel 11 Pro s’élève à environ 191 Mo pour les poids du texte et à environ 567 Mo pour la version multimodale complète. La fenêtre de contexte propose désormais 8K tokens, soit un quadruplement par rapport à la génération précédente, ce qui permet de gérer jusqu’à 5,5 minutes d’audio, 29 images, 58 images vidéo ou des assemblages locaux de ces éléments. La structure modulaire du modèle donne la possibilité de recourir à seulement 270 millions de paramètres pour le texte, tandis que des encodeurs optionnels de 170 millions sont prévus pour la vision et de 300 millions pour l’audio. Pour le stockage, l’approche Matryoshka autorise la troncature de 768 dimensions vers 512, 256 ou 128, avec une réduction de stockage annoncée jusqu’à six fois.

Scores revendiqués sur MTEB Code et MAEB

L’éditeur affirme que le modèle atteint des scores de tête parmi les modèles de moins d’un milliard de paramètres sur des benchmarks tels que MTEB Code et MAEB, tout en égalant ou dépassant des systèmes plus grands sur des tâches texte, vision et audio. Sur le code, le gain annoncé est de 9,92 points dans MTEB Code, de 68,76 à 78,68, tout en conservant la performance textuelle multilingue de la génération précédente. Dans les domaines image, vidéo, documents et audio, l’éditeur présente le modèle comme établissant une nouvelle norme de qualité par paramètre sous le milliard et dépassant certains modèles spécialisés plus de deux fois plus grands. L’ensemble est décrit comme le plus performant pour des embeddings multimodaux sur appareil.

Socle technique, licence et périmètre multimodal

Le modèle s’appuie sur l’architecture Gemma 4, totalise 740 millions de paramètres et est distribué sous licence Apache 2.0 permissive à visée commerciale. Il partage avec Gemma 4 le tokenizer de texte et l’encodeur audio, les deux pouvant être exécutés ensemble dans un pipeline unifié annoncé avec une empreinte mémoire combinée réduite. L’espace d’embedding couvre nativement texte, images, audio et vidéo, avec un positionnement présenté comme optimal pour l’inférence sur appareil. La première génération, lancée l’année précédente pour les embeddings textuels, a suscité un fort usage selon l’éditeur, avec plus de 20 millions de téléchargements, des usages en recherche sur appareil et des pipelines RAG axés sur la confidentialité.

Usages sur appareil, recherche croisée et RAG

Le modèle apporte des capacités localement sur le matériel de périphérie. Selon l’éditeur, produire les embeddings sur l’appareil aide à préserver la confidentialité, réduit la latence et rend possibles des recherches et récupérations croisées hors ligne. Associé à des modèles génératifs comme Gemma 4, il est donné comme habilitant des pipelines RAG sur appareil capables d’englober des données multimodales complexes. Parmi les cas d’usage décrits figurent la recherche par similarité sémantique dans une bibliothèque multimédia depuis un texte ou une image, la localisation de moments précis dans une vidéo à partir d’une requête textuelle ou audio, et la combinaison avec Gemma 4 pour la récupération locale et le raisonnement contextuel. L’éditeur cite aussi des exemples comme la recherche d’un clip vidéo à partir d’un mémo vocal, ou des requêtes texte sur des enregistrements audio, effectués par un seul modèle multimodal.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires