🧠ModèlesVLM
Modèle vision-langage
Vision-Language Model · VLM
Définition
Un modèle vision-langage comprend à la fois les images et le texte, permettant de décrire une photo, lire un graphique ou répondre à des questions sur une capture d'écran. C'est une forme spécialisée de modèle multimodal. Cette capacité est essentielle pour les agents qui interagissent avec des interfaces visuelles.
Exemple concret
💡 Envoyer une photo de ton frigo à un assistant IA et lui demander des recettes possibles repose sur un modèle vision-langage.
Termes liés
Questions fréquentes
Que veut dire VLM ?
VLM signifie Modèle vision-langage (en anglais : Vision-Language Model). Un modèle vision-langage comprend à la fois les images et le texte, permettant de décrire une photo, lire un graphique ou répondre à des questions sur une capture d'écran. C'est une forme spécialisée de modèle multimodal. Cette capacité est essentiel…
Qu'est-ce que VLM (Modèle vision-langage) en intelligence artificielle ?
Un modèle vision-langage comprend à la fois les images et le texte, permettant de décrire une photo, lire un graphique ou répondre à des questions sur une capture d'écran. C'est une forme spécialisée de modèle multimodal. Cette capacité est essentielle pour les agents qui interagissent avec des interfaces visuelles.
À quoi sert VLM ?
Envoyer une photo de ton frigo à un assistant IA et lui demander des recettes possibles repose sur un modèle vision-langage.
Quels sont les concepts liés à VLM ?
Les concepts liés à Modèle vision-langage incluent : Multimodal, Vision par ordinateur, Grand modèle de langage, Modèle de fondation. Retrouvez chaque définition dans le glossaire IA de Brief IA.
📬 Newsletter gratuite
Ne rate rien de l'actu IA
Reçois chaque soir les 7 meilleures actus IA, décryptées en 5 min. Gratuit.