Tu codes avec l’IA ?
Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI revendique la supériorité de GPT-5.6 Sol
OpenAI a récemment annoncé que son modèle GPT-5.6 Sol a surpassé le modèle Opus 5 d'Anthropic dans le test ARC-AGI-3. Le modèle d'OpenAI a atteint un score impressionnant de 38,3 %, mais cette performance a été réalisée en utilisant des fonctionnalités spécifiques de son API, plutôt que la configuration de test officielle.
Dans la configuration standard du test, GPT-5.6 Sol n'a obtenu qu'un score de 7,8 %. Cette différence notable soulève des questions sur la manière dont les tests de performance sont menés et sur l'impact des outils utilisés sur les résultats.
Neutralité du test ARC remise en question
Le prix ARC, qui se veut neutre vis-à-vis des fournisseurs, pourrait avoir utilisé une API obsolète lors de ses tests. Cela pourrait avoir faussé la comparaison entre GPT-5.6 Sol et Opus 5, remettant en question l'impartialité de l'environnement de test. Cette situation met en lumière l'importance de l'actualisation des outils utilisés pour évaluer les modèles d'intelligence artificielle.






