Brief IA : OpenAI : GPT-5.6 Sol surpasse Opus 5 avec une API optimisée

OpenAI : GPT-5.6 Sol surpasse Opus 5 avec une API optimisée

Brief IA
Tom Levy·2 min·22 vues

OpenAI revendique que GPT-5.6 Sol dépasse Opus 5 sur le benchmark ARC-AGI-3 avec un score de 38,3 %. Ce score a été obtenu grâce à des fonctionnalités spécifiques de l'API d'OpenAI, soulevant des questions sur la fiabilité des comparaisons de performances entre modèles d'IA.

En bref
1OpenAI revendique que GPT-5.6 Sol dépasse Opus 5 sur ARC-AGI-3 avec un score de 38,3 %.
2Ce score élevé a été obtenu grâce à l'utilisation de fonctionnalités spécifiques de l'API d'OpenAI, plutôt qu'à la configuration de test standard.
3Le prix ARC pourrait avoir utilisé une API obsolète, remettant en question la neutralité de son environnement de test.
💡Pourquoi c'est importantCette situation soulève des questions sur la fiabilité des comparaisons de performances entre modèles d'IA, influencées par les outils utilisés.
Le brief IA que lisent les pros

Tu codes avec l’IA ?

Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

OpenAI : GPT-5.6 Sol surpasse Opus 5 avec une API optimisée

OpenAI affirme que GPT-5.6 Sol surpasse Opus 5 sur le benchmark ARC-AGI-3 grâce à sa dernière API et deux paramètres supplémentaires.

Le co-fondateur du ARC Prize, François Chollet, a réagi aux résultats d'OpenAI en faisant la distinction entre deux types de configurations de test. Il a déclaré que les configurations "sur mesure pour résoudre le benchmark ou contenant des connaissances sur le format du benchmark" ne sont pas acceptables. En revanche, les paramètres d'API généralistes "qui n'ont pas été développés pour ARC-AGI-3 et qui sont disponibles pour tous les utilisateurs d'API" sont considérés comme valables. Chollet concède ainsi que le score de GPT-5.6 Sol dans le cadre de l'ARC Prize a désavantagé OpenAI.

Il a noté que l'ARC Prize a eu "beaucoup d'échanges avec OpenAI sur la meilleure façon de tester leurs modèles, notamment en ce qui concerne la compaction", et a accueilli le fait que l'entreprise "commence à trouver des réponses". Chollet a également souligné que l'utilisation de différents paramètres par différents fournisseurs crée "un potentiel problème de parité", mais il considère cela acceptable "tant que les paramètres et les coûts sont clairement rapportés".

OpenAI affirme qu'elle peut rivaliser sur ARC-AGI-3. Après que Claude Opus 5 d'Anthropic ait quadruplé le score record sur le benchmark logique, OpenAI montre maintenant que GPT-5.6 Sol atteint 38,3 % avec deux paramètres d'API, surpassant les 30,2 % d'Opus 5.

Les scores d'ARC-AGI-3 de GPT-5.6 Sol augmentent considérablement lorsqu'il utilise le Responses API d'OpenAI avec "Retained Reasoning", qui maintient la chaîne de pensée du modèle entre les étapes, et "Compaction", qui résume le contexte ancien au lieu de le tronquer. Dans l'environnement de test officiel, GPT-5.6 Sol n'a obtenu que 7,8 % car le raisonnement du modèle est abandonné après chaque action.

OpenAI soutient que les benchmarks ne mesurent jamais uniquement le modèle, mais aussi la configuration technique qui l'entoure. Cela est vrai, et ARC-AGI-3 est conçu pour tester la performance pure du modèle. Les scores officiels de l'ARC utilisent une approche standardisée sans paramètres spécifiques aux fournisseurs pour garantir des comparaisons équitables, a déclaré l'ARC Prize en réponse aux résultats d'OpenAI. Le point de discorde est de savoir si l'ARC Prize a utilisé une "API de complétions de style OpenAI" plus ancienne qui manquait des fonctionnalités déjà offertes par l'API Claude, ce qui rendrait la comparaison injuste pour OpenAI.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires