Brief IA

Agents IA : Claude Fable 5.1 devant GPT‑6 Astra en septembre

🛠️ AI Tools·Tom Levy·

Agents IA : Claude Fable 5.1 devant GPT‑6 Astra en septembre

Agents IA : Claude Fable 5.1 devant GPT‑6 Astra en septembre
Key Takeaways
1Claude Fable 5.1 prend la tête du classement agentique d'Arena devant GPT-6 Astra
2Le classement repose sur cinq signaux issus de près de 1,7 million de sessions sur 43 modèles
3Anthropic occupe six places sur dix, OpenAI trois, le reste du peloton voit Tencent, DeepSeek, Z.ai et Meta progresser
💡Why it mattersCe classement, basé sur des sessions réelles, met en avant la diversité des forces des modèles et l'évolution rapide du paysage agentique.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Le tableau agentique d'Arena de mi-septembre 2026 place Claude Fable 5.1 en tête, devant GPT-6 Astra. Le verdict agrège cinq signaux issus de près de 1,7 million de sessions sur 43 modèles, observées en conditions réelles dans Agent Mode. Anthropic occupe six places sur dix, mais OpenAI remonte et prend la deuxième place.

Des leaders différents selon les signaux mesurés

Aucun modèle ne domine l'ensemble des cinq critères agrégés. Claude Fable 5.1 obtient le taux le plus élevé de tâches validées par les utilisateurs. C'est GPT-6 Astra qui affiche la part la plus importante de retours positifs. Les deux éditions de Claude Opus 5 se distinguent pour l'intégration des corrections et la capacité à se remettre sur la bonne voie après une commande échouée. Parmi les dix premiers, seul GPT-6 Astra présente un score de steerability négatif, indicateur de la réaction du modèle lorsqu'un utilisateur le corrige. Les cinq signaux pris en compte couvrent la validation ou le rejet par l'utilisateur, les appréciations en langage naturel, l'intégration des corrections, la remise sur rails après une commande ratée et l'invocation d'outils indisponibles.

Comment Arena évalue les modèles en mode agent

Le classement agentique d'Arena ne reprend ni les duels anonymisés ni le score Elo de son classement général. La plateforme utilise une méthodologie dite causal tracing. Les performances sont observées dans Agent Mode, une sandbox ouverte en juin où l'utilisateur délègue un workflow complet à un agent pouvant mobiliser plusieurs outils. Le modèle aux commandes change aléatoirement entre les sessions pour isoler sa contribution au résultat. Le verdict actuel repose sur près de 1,7 million de sessions couvrant 43 modèles.

Un top 10 dominé par Anthropic, OpenAI en embuscade

Claude Fable 5.1, disponible en version Max depuis le 1er septembre, s'impose dès son lancement. GPT-6 Astra, qui a été rendu public deux jours plus tard et qui est le premier modèle d'OpenAI à être répertorié au niveau de risque cyber le plus élevé, se classe en deuxième position. Les deux variantes de Claude Opus 5 occupent les troisième et quatrième places, suivies par Claude Fable 5 et Claude Opus 4.8. Anthropic occupe six des dix premières places, quand OpenAI en compte trois, avec notamment Claude Sonnet 5, neuvième, et GPT-5.6 Sol, septième après une troisième place en août. Kimi K3 recule de la cinquième à la huitième marche. L'ordre complet des dix premiers est publié, avec en dixième position GPT 5.5. Le mois précédent, le meilleur modèle d'OpenAI n'était que quatrième.

Au-delà du podium: un peloton resserré et des reculs

Hy4 preview de Tencent entre au classement en onzième position, devant DeepSeek V4.1 Flash, GLM 5.2 (Z.ai) et Muse Spark 1.3, qui représente la plus récente version du modèle agentique de Meta. En août, il fallait atteindre la treizième place pour identifier un acteur différent d'Anthropic, OpenAI ou Moonshot AI, et la vingt-deuxième pour voir apparaître Meta. Google reste à distance avec Gemini 3.6 Flash en trente-quatrième position. Mistral figure au quarante et unième rang, seul acteur européen de ce tableau.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.