Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Le tableau agentique d'Arena de mi-septembre 2026 place Claude Fable 5.1 en tête, devant GPT-6 Astra. Le verdict agrège cinq signaux issus de près de 1,7 million de sessions sur 43 modèles, observées en conditions réelles dans Agent Mode. Anthropic occupe six places sur dix, mais OpenAI remonte et prend la deuxième place.
Des leaders différents selon les signaux mesurés
Aucun modèle ne domine l'ensemble des cinq critères agrégés. Claude Fable 5.1 obtient le taux le plus élevé de tâches validées par les utilisateurs. C'est GPT-6 Astra qui affiche la part la plus importante de retours positifs. Les deux éditions de Claude Opus 5 se distinguent pour l'intégration des corrections et la capacité à se remettre sur la bonne voie après une commande échouée. Parmi les dix premiers, seul GPT-6 Astra présente un score de steerability négatif, indicateur de la réaction du modèle lorsqu'un utilisateur le corrige. Les cinq signaux pris en compte couvrent la validation ou le rejet par l'utilisateur, les appréciations en langage naturel, l'intégration des corrections, la remise sur rails après une commande ratée et l'invocation d'outils indisponibles.
Comment Arena évalue les modèles en mode agent
Le classement agentique d'Arena ne reprend ni les duels anonymisés ni le score Elo de son classement général. La plateforme utilise une méthodologie dite causal tracing. Les performances sont observées dans Agent Mode, une sandbox ouverte en juin où l'utilisateur délègue un workflow complet à un agent pouvant mobiliser plusieurs outils. Le modèle aux commandes change aléatoirement entre les sessions pour isoler sa contribution au résultat. Le verdict actuel repose sur près de 1,7 million de sessions couvrant 43 modèles.
Un top 10 dominé par Anthropic, OpenAI en embuscade
Claude Fable 5.1, disponible en version Max depuis le 1er septembre, s'impose dès son lancement. GPT-6 Astra, qui a été rendu public deux jours plus tard et qui est le premier modèle d'OpenAI à être répertorié au niveau de risque cyber le plus élevé, se classe en deuxième position. Les deux variantes de Claude Opus 5 occupent les troisième et quatrième places, suivies par Claude Fable 5 et Claude Opus 4.8. Anthropic occupe six des dix premières places, quand OpenAI en compte trois, avec notamment Claude Sonnet 5, neuvième, et GPT-5.6 Sol, septième après une troisième place en août. Kimi K3 recule de la cinquième à la huitième marche. L'ordre complet des dix premiers est publié, avec en dixième position GPT 5.5. Le mois précédent, le meilleur modèle d'OpenAI n'était que quatrième.
Au-delà du podium: un peloton resserré et des reculs
Hy4 preview de Tencent entre au classement en onzième position, devant DeepSeek V4.1 Flash, GLM 5.2 (Z.ai) et Muse Spark 1.3, qui représente la plus récente version du modèle agentique de Meta. En août, il fallait atteindre la treizième place pour identifier un acteur différent d'Anthropic, OpenAI ou Moonshot AI, et la vingt-deuxième pour voir apparaître Meta. Google reste à distance avec Gemini 3.6 Flash en trente-quatrième position. Mistral figure au quarante et unième rang, seul acteur européen de ce tableau.






