La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Gemini Embeddings 2 : une avancée majeure pour l'intégration multimodale
L'essor des modèles de langage de grande taille
Google a récemment présenté Gemini Embeddings 2 Preview, une innovation qui se distingue par sa capacité à intégrer divers types de contenu comme le texte, les PDF, les images, l'audio et la vidéo. Ce modèle d'embedding se positionne comme un outil polyvalent, essentiel pour l'intégration de contenus multimodaux dans les applications d'intelligence artificielle.
L'embedding est une technologie centrale dans le domaine de la génération augmentée par récupération (RAG), qui est l'une des applications les plus fondamentales dans le traitement moderne de l'IA.
Comprendre RAG et l'embedding
La méthode RAG repose sur la segmentation, l'encodage et le stockage d'informations qui peuvent être recherchées via des fonctions de similarité. Ces fonctions associent des termes de recherche aux informations intégrées. L'encodage transforme les requêtes en une série de nombres appelés vecteurs, ce qui constitue l'essence de l'embedding. Ces vecteurs sont stockés dans une base de données vectorielle.
Lorsqu'un utilisateur effectue une recherche, le terme est également encodé en embeddings. Les vecteurs résultants sont ensuite comparés au contenu de la base de données vectorielle, souvent à l'aide de la similarité cosinus. Plus les vecteurs des termes de recherche sont proches des informations stockées, plus la pertinence est élevée. Les modèles de langage de grande taille peuvent alors interpréter ces données pour récupérer et afficher les informations les plus pertinentes.
L'innovation de Gemini Embedding
Le modèle Gemini de Google se distingue par sa capacité à intégrer des entrées multi-modales. Contrairement aux modèles traditionnels qui se limitaient souvent au texte et aux PDF, Gemini offre la possibilité d'intégrer des images, de l'audio et de la vidéo. Bien que ce modèle soit encore en phase préliminaire, ses capacités promettent de transformer l'utilisation des embeddings.
Limites actuelles des entrées
Le modèle Gemini impose certaines restrictions sur les types d'entrées qu'il peut traiter :
- Texte : Jusqu'à 8192 tokens, soit environ 6000 mots.
- Images : Jusqu'à 6 images par requête, prenant en charge les formats PNG et JPEG.
- Vidéos : Durée maximale de 2 minutes, formats MP4 et MOV.
- Audio : Durée maximale de 80 secondes, formats MP3 et WAV.
- Documents : Longueur maximale de 6 pages.
Configuration d'un environnement de développement
Pour exploiter pleinement le potentiel de Gemini Embeddings 2, il est conseillé de configurer un environnement de développement dédié. L'outil UV peut être utilisé pour cela, mais d'autres méthodes peuvent également convenir selon les préférences.
$ uv init embed-test --python 3.13
$ source embed-test/bin/activate
$ uv add google-genai jupyter numpy scikit-learn audioop-lts
$ uv run jupyter notebook
Une clé API Gemini est nécessaire, disponible sur la page d'accueil de Google AI Studio. Après connexion, un lien "Get API Key" est accessible en bas à gauche de l'écran.
Exemple d'usage : Embedding d'images
Pour illustrer l'utilisation de Gemini, considérons l'intégration de 3 images : un chat roux, un Labrador et un dauphin jaune. L'objectif est de poser des questions ou phrases spécifiques et de voir si le modèle peut identifier l'image la plus pertinente. Cela est réalisé en calculant un score de similarité entre chaque question et image.
Les questions posées incluent :
- Quel animal est jaune ?
- Lequel est le plus susceptible de s'appeler Rover ?
- Il se passe quelque chose de louche ici.
- Une image parfaite.
Exemple d'usage : Embedding audio
Pour l'audio, un enregistrement d'un homme décrivant une sortie de pêche est utilisé. Il raconte avoir vu un dauphin jaune brillant. La transcription complète est :
« Bonjour, je m'appelle Glen, et je veux vous parler d'un spectacle fascinant que j'ai vu mardi après-midi en pêchant en mer avec des amis. C'était une journée chaude avec un soleil jaune dans le ciel. Nous pêchions le thon et n'avions pas de chance. Nous avons dû passer la meilleure partie de 5 heures là-bas. Nous étions donc assez abattus en rentrant sur la terre ferme. Mais soudain, et je jure que ce n'est pas un mensonge, nous avons vu un banc de dauphins. Non seulement cela, mais l'un d'eux était d'une couleur jaune éclatante. Nous n'avons jamais rien vu de tel de notre vie, mais je peux vous dire que toutes nos pensées d'une mauvaise journée de pêche ont disparu. C'était fascinant. »
L'objectif est de déterminer où le locuteur mentionne le dauphin jaune, démontrant ainsi la capacité du modèle à traiter des données audio de manière efficace.

