Brief IA : Gemini surpasse ChatGPT pour l’identification d’images

Gemini surpasse ChatGPT pour l’identification d’images

Brief IA
Tom Levy·4 min·2 vues

Gemini a surpassé ChatGPT dans l'identification d'images, en attribuant correctement un texte manuscrit à Conan Doyle et en reconnaissant des œuvres inspirées d'Hocus Pocus. Bien que ChatGPT ait fourni une réponse plus détaillée sur une plante carnivore, ces tests soulignent les avancées de Gemini en vision par image, mettant en lumière les forces et les faiblesses des deux chatbots.

En bref
1Gemini a correctement attribué un texte manuscrit à Conan Doyle et reconnu des œuvres inspirées d’Hocus Pocus
2ChatGPT a donné une réponse plus détaillée sur la photo d’une Dionée, mais n’a pas identifié le film
3Sur une position d’échecs, un arbitrage tiers a jugé la réponse de ChatGPT plus adaptée, mais le test est écarté faute d’avis expert
💡Pourquoi c'est importantCes tests illustrent les progrès et les limites de la vision par image des principaux chatbots IA, avec Gemini qui prend l’avantage pour l’identification visuelle.
Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Quatre épreuves en photo, mêmes prompts, deux chatbots face à face. Gemini s’impose sur l’identification d’un texte griffonné et d’une référence de film, quand ChatGPT donne la réponse la plus fouillée sur une plante carnivore. Sur une position d’échecs, un avis tiers juge la proposition de ChatGPT plus adaptée, mais l’absence d’expertise officielle empêche de trancher.

Échecs : avis tiers contradictoires, verdict mis entre parenthèses

Des recommandations différentes ont été données pour une position d’échecs issue de la chaîne YouTube de la Esports World Cup. Gemini a proposé une ligne détaillée avec Bxf4 comme coup final. ChatGPT a décrit avoir installé des bibliothèques d’échecs et recherché un moteur Stockfish local, a mis plus de 4 minutes à répondre et a retenu c5–d4, en citant Bxf4 comme deuxième option. Sollicitée, la US Chess Federation n’a pas répondu. Un arbitrage demandé à Claude conclut que Gemini lisait mal le plateau et que la réponse de ChatGPT était la plus appropriée. Faute d’avis expert, ce test d’échecs est écarté du bilan général.

Reconnaître un texte manuscrit et une œuvre : avantage Gemini

Sur une page recopiée à la volée depuis The Hound of the Baskervilles à l’aide d’un Boox Note Air 5C, ChatGPT a mal transcrit la première ligne, la rendant sous la forme « Un moment sera toujours ce moment — [Henry ?] à Merritt House », et a interprété le passage comme des notes liées à Henry, Sir Henry et à une sœur, avec des segments incertains placés entre crochets. Gemini a livré une transcription mot à mot, identifié correctement la source et décrit des traits de l’écriture tels que des boucles ouvertes sur y, g et f. L’identification de la source est considérée comme ayant pu favoriser l’exactitude de la transcription, l’écart étant jugé net. Un autre essai portait sur trois tableaux peints à la main représentant les bouches des sœurs Sanderson de Hocus Pocus, non officiels. ChatGPT n’a pas reconnu le film, se limitant à décrire « trois peintures en forme de diamant » et a réclamé des précisions comme l’année de sortie. Gemini a identifié sans difficulté Hocus Pocus (1993), précisé la position des personnages et rappelé le nom des actrices.

Dionée : deux diagnostics valables, ChatGPT plus prolixe

À partir de la photo d’une Dionée, il était demandé d’indiquer le cultivar — donné comme un géant — et la cause d’un piège noirci. Gemini n’a pas trouvé le nom correct du cultivar mais a listé plusieurs explications plausibles, dont celle d’un insecte trop gros. ChatGPT a fourni une réponse comparable, plus détaillée, en expliquant ne pas pouvoir attribuer un cultivar au piège montré et en ajoutant des éléments sur les causes du noircissement ainsi qu’une section de conseils pratiques. Les deux réponses ont été jugées justes, avec un avantage accordé à ChatGPT pour la richesse des détails.

Protocole commun : photos fixes, mêmes invites, pas de complexité

Les épreuves sont restées simples et ont été conduites uniquement à partir de photos, sans flux vidéo. Chaque image a été soumise aux deux chatbots avec des invites identiques. L’exercice revisite la reconnaissance visuelle de Gemini Live, après des améliorations annoncées en multimodalité pour ChatGPT et Gemini Flash, dans un contexte où l’usage de la caméra pour appuyer l’identification par l’IA se généralise. ChatGPT est décrit comme le plus connu des chatbots, tandis que Gemini a vu sa popularité progresser ; tous deux sont réputés performants en traitement de texte.

Bilan : Gemini devant pour « voir », avec réserve sur les échecs

La constance de Gemini et son aptitude à relier correctement une image à sa source — qu’il s’agisse d’un texte manuscrit ou d’une référence cinématographique — conduisent à le placer en tête pour la description d’images. Cette avance est nuancée : les écarts globaux entre ChatGPT, Claude et Gemini sont décrits comme limités et l’épreuve d’échecs n’est pas comptabilisée.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires