Tu codes avec l’IA ?
Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI : GPT-5.6 Sol surpasse Opus 5 avec une API optimisée
OpenAI affirme que GPT-5.6 Sol surpasse Opus 5 sur le benchmark ARC-AGI-3 grâce à sa dernière API et deux paramètres supplémentaires.
Le co-fondateur du ARC Prize, François Chollet, a réagi aux résultats d'OpenAI en faisant la distinction entre deux types de configurations de test. Il a déclaré que les configurations "sur mesure pour résoudre le benchmark ou contenant des connaissances sur le format du benchmark" ne sont pas acceptables. En revanche, les paramètres d'API généralistes "qui n'ont pas été développés pour ARC-AGI-3 et qui sont disponibles pour tous les utilisateurs d'API" sont considérés comme valables. Chollet concède ainsi que le score de GPT-5.6 Sol dans le cadre de l'ARC Prize a désavantagé OpenAI.
Il a noté que l'ARC Prize a eu "beaucoup d'échanges avec OpenAI sur la meilleure façon de tester leurs modèles, notamment en ce qui concerne la compaction", et a accueilli le fait que l'entreprise "commence à trouver des réponses". Chollet a également souligné que l'utilisation de différents paramètres par différents fournisseurs crée "un potentiel problème de parité", mais il considère cela acceptable "tant que les paramètres et les coûts sont clairement rapportés".
OpenAI affirme qu'elle peut rivaliser sur ARC-AGI-3. Après que Claude Opus 5 d'Anthropic ait quadruplé le score record sur le benchmark logique, OpenAI montre maintenant que GPT-5.6 Sol atteint 38,3 % avec deux paramètres d'API, surpassant les 30,2 % d'Opus 5.
Les scores d'ARC-AGI-3 de GPT-5.6 Sol augmentent considérablement lorsqu'il utilise le Responses API d'OpenAI avec "Retained Reasoning", qui maintient la chaîne de pensée du modèle entre les étapes, et "Compaction", qui résume le contexte ancien au lieu de le tronquer. Dans l'environnement de test officiel, GPT-5.6 Sol n'a obtenu que 7,8 % car le raisonnement du modèle est abandonné après chaque action.
OpenAI soutient que les benchmarks ne mesurent jamais uniquement le modèle, mais aussi la configuration technique qui l'entoure. Cela est vrai, et ARC-AGI-3 est conçu pour tester la performance pure du modèle. Les scores officiels de l'ARC utilisent une approche standardisée sans paramètres spécifiques aux fournisseurs pour garantir des comparaisons équitables, a déclaré l'ARC Prize en réponse aux résultats d'OpenAI. Le point de discorde est de savoir si l'ARC Prize a utilisé une "API de complétions de style OpenAI" plus ancienne qui manquait des fonctionnalités déjà offertes par l'API Claude, ce qui rendrait la comparaison injuste pour OpenAI.





