La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Sentence Transformers : une avancée dans l'embedding multimodal
La bibliothèque Sentence Transformers est un outil essentiel pour les développeurs cherchant à utiliser et entraîner des modèles d'embedding et de reranking. Ces modèles sont cruciaux pour des applications telles que la génération augmentée par récupération et la recherche sémantique. Cet article détaille comment ces modèles peuvent être ajustés sur des données spécifiques pour améliorer leur performance.
Exemple pratique : ajustement pour la récupération de documents visuels
Un exemple concret d'application est l'ajustement du modèle Qwen/Qwen3-VL-Embedding-2B pour la Récupération de Documents Visuels (VDR). Cette tâche consiste à récupérer des pages de documents pertinentes sous forme d'images, tout en conservant leur mise en page originale, en réponse à une requête textuelle. Le modèle ajusté, nommé tomaarsen/Qwen3-VL-Embedding-2B-vdr, a démontré des améliorations significatives. Sur des données d'évaluation, il a atteint un NDCG@10 de 0.947, surpassant le modèle de base qui avait un score de 0.888. Ce résultat est notable car il surpasse tous les modèles VDR existants testés, même ceux ayant une taille jusqu'à quatre fois supérieure.
Composants essentiels de l'entraînement
L'entraînement des modèles multimodaux avec Sentence Transformers repose sur les mêmes composants que pour les modèles textuels. Ces composants incluent le modèle à ajuster, le dataset, la fonction de perte, et éventuellement des arguments d'entraînement et un évaluateur. Le processus d'entraînement est orchestré par le SentenceTransformerTrainer, qui gère automatiquement le prétraitement des images et autres modalités.
Le modèle multimodal à entraîner ou à ajuster est central dans ce processus. Le dataset utilisé pour l'entraînement et l'évaluation doit être soigneusement sélectionné pour correspondre à la tâche spécifique. La fonction de perte quantifie la performance du modèle et guide le processus d'optimisation. Des arguments d'entraînement optionnels peuvent influencer la performance d'entraînement et faciliter le suivi et le débogage. Un évaluateur peut être utilisé pour évaluer le modèle avant, pendant ou après l'entraînement.
Dataset pour la récupération de documents visuels
Pour illustrer cet ajustement, le dataset tomaarsen/llamaindex-vdr-en-train-preprocessed a été utilisé. Ce sous-ensemble prétraité en anglais provient de llamaindex/vdr-multilingual-train. Le dataset original, publié par LlamaIndex, contient environ 500k échantillons de requêtes-images multilingues issues de PDF publics. Les requêtes ont été générées de manière synthétique à l'aide de VLMs tels que gemini-1.5-pro et Qwen2-VL-72B.
Dans la version prétraitée, 53,512 échantillons en anglais ont été sélectionnés. Cette version résout 4 des 16 négatifs difficiles basés sur l'ID par échantillon en images réelles de captures d'écran de documents, ce qui permet une utilisation directe pour l'entraînement sans prétraitement supplémentaire.
Le format du dataset doit être compatible avec la fonction de perte choisie. Si un label est requis, une colonne "label" ou "score" doit être présente. Les autres colonnes sont considérées comme des inputs, qui peuvent inclure des images, de l'audio, de la vidéo, ou des dictionnaires multimodaux. Le collateur de données utilise model.preprocess() pour détecter et traiter automatiquement chaque modalité, éliminant ainsi le besoin de tokenisation ou de traitement manuel des images.





