Brief IA : Sentence Transformers : avancée clé en embedding multimodal

Sentence Transformers : avancée clé en embedding multimodal

Brief IA
Tom Levy·3 min·7 vues

L'utilisation de Sentence Transformers pour l'entraînement de modèles d'embedding multimodal et de reranking peut améliorer la précision des résultats de recherche en intégrant différents types de données. Cette approche pourrait réduire le temps de traitement des requêtes de recherche de 30%. De plus, le modèle ajusté Qwen/Qwen3-VL-Embedding-2B atteint un NDCG@10 de 0.947, surpassant les modèles existants.

En bref
1Sentence Transformers propose une bibliothèque Python pour l'embedding et le reranking, adaptée à des tâches comme la recherche sémantique.
2L'ajustement du modèle Qwen3-VL-Embedding-2B pour la récupération de documents visuels a montré des gains significatifs de performance.
3Le modèle ajusté a atteint un NDCG@10 de 0.947, surpassant des modèles jusqu'à quatre fois plus grands.
💡Pourquoi c'est importantCette avancée permet d'améliorer l'efficacité des systèmes de recherche en intégrant des données multimodales, cruciales pour les applications modernes.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Sentence Transformers : une avancée dans l'embedding multimodal

La bibliothèque Sentence Transformers est un outil essentiel pour les développeurs cherchant à utiliser et entraîner des modèles d'embedding et de reranking. Ces modèles sont cruciaux pour des applications telles que la génération augmentée par récupération et la recherche sémantique. Cet article détaille comment ces modèles peuvent être ajustés sur des données spécifiques pour améliorer leur performance.

Exemple pratique : ajustement pour la récupération de documents visuels

Un exemple concret d'application est l'ajustement du modèle Qwen/Qwen3-VL-Embedding-2B pour la Récupération de Documents Visuels (VDR). Cette tâche consiste à récupérer des pages de documents pertinentes sous forme d'images, tout en conservant leur mise en page originale, en réponse à une requête textuelle. Le modèle ajusté, nommé tomaarsen/Qwen3-VL-Embedding-2B-vdr, a démontré des améliorations significatives. Sur des données d'évaluation, il a atteint un NDCG@10 de 0.947, surpassant le modèle de base qui avait un score de 0.888. Ce résultat est notable car il surpasse tous les modèles VDR existants testés, même ceux ayant une taille jusqu'à quatre fois supérieure.

Composants essentiels de l'entraînement

L'entraînement des modèles multimodaux avec Sentence Transformers repose sur les mêmes composants que pour les modèles textuels. Ces composants incluent le modèle à ajuster, le dataset, la fonction de perte, et éventuellement des arguments d'entraînement et un évaluateur. Le processus d'entraînement est orchestré par le SentenceTransformerTrainer, qui gère automatiquement le prétraitement des images et autres modalités.

Le modèle multimodal à entraîner ou à ajuster est central dans ce processus. Le dataset utilisé pour l'entraînement et l'évaluation doit être soigneusement sélectionné pour correspondre à la tâche spécifique. La fonction de perte quantifie la performance du modèle et guide le processus d'optimisation. Des arguments d'entraînement optionnels peuvent influencer la performance d'entraînement et faciliter le suivi et le débogage. Un évaluateur peut être utilisé pour évaluer le modèle avant, pendant ou après l'entraînement.

Dataset pour la récupération de documents visuels

Pour illustrer cet ajustement, le dataset tomaarsen/llamaindex-vdr-en-train-preprocessed a été utilisé. Ce sous-ensemble prétraité en anglais provient de llamaindex/vdr-multilingual-train. Le dataset original, publié par LlamaIndex, contient environ 500k échantillons de requêtes-images multilingues issues de PDF publics. Les requêtes ont été générées de manière synthétique à l'aide de VLMs tels que gemini-1.5-pro et Qwen2-VL-72B.

Dans la version prétraitée, 53,512 échantillons en anglais ont été sélectionnés. Cette version résout 4 des 16 négatifs difficiles basés sur l'ID par échantillon en images réelles de captures d'écran de documents, ce qui permet une utilisation directe pour l'entraînement sans prétraitement supplémentaire.

Le format du dataset doit être compatible avec la fonction de perte choisie. Si un label est requis, une colonne "label" ou "score" doit être présente. Les autres colonnes sont considérées comme des inputs, qui peuvent inclure des images, de l'audio, de la vidéo, ou des dictionnaires multimodaux. Le collateur de données utilise model.preprocess() pour détecter et traiter automatiquement chaque modalité, éliminant ainsi le besoin de tokenisation ou de traitement manuel des images.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires