Le 22 septembre 2026, Anthropic a lancé Opus 5.5, le premier modèle de sa nouvelle famille Claude 5.5. Son positionnement est précis : traiter les tâches de codage longues, explorer de grandes bases de code et exécuter des workflows plus agentiques, tout en réduisant de 40 % le coût d’exécution par rapport à Opus 5 sur les charges de travail typiques. Sur Terminal-Bench 4.0, Opus 5.5 atteint 66,4 %, contre 55,8 % pour Fable 5.1 et 57,9 % pour GPT-6 Astra. Ces résultats placent le modèle d’Anthropic en tête des comparaisons publiées pour le codage agentique.
Le choix ne se résume toutefois pas à un score. Fable 5.1 reste présenté comme une référence sur les tâches générales, GPT-6 Astra se montre compétitif sur certains tests, et GPT-5.6 Sol vise un autre compromis entre coût, disponibilité et performance. Voici ce que les données publiées permettent de retenir pour choisir un modèle de codage en 2026.
Opus 5.5 réduit le coût d’Opus 5 sans viser le milieu de gamme
L’intérêt principal d’Opus 5.5 tient à la combinaison entre performance de pointe et baisse du coût d’exécution. Anthropic indique que le modèle coûte 40 % moins cher à exécuter qu’Opus 5 dans les conditions d’utilisation habituelles, avec les réglages par défaut.
Les tarifs annoncés pour l’API sont de 4 dollars par million de tokens en entrée et de 20 dollars par million de tokens en sortie. Les lectures depuis le cache sont facturées 0,20 dollar par million de tokens. Opus 5.5 conserve ainsi un positionnement haut de gamme, mais l’écart tarifaire avec Opus 5 devient significatif pour les agents qui analysent des dépôts entiers ou répètent de nombreuses étapes de raisonnement.
| Modèle | Entrée par million de tokens | Sortie par million de tokens | Performance Terminal-Bench 4.0 |
|---|---|---|---|
| Opus 5.5 | 4 $ | 20 $ | 66,4 % |
| Fable 5.1 | Donnée publiée non retenue | Donnée publiée non retenue | 55,8 % |
| GPT-6 Astra | Donnée publiée non retenue | Donnée publiée non retenue | 57,9 % |
| GPT-5.6 Sol | Donnée publiée non retenue | Donnée publiée non retenue | 37,3 % |
Opus 5.5 n’est donc pas présenté comme une version économique au sens strict. Son avantage est ailleurs : Anthropic cherche à rendre les tâches complexes plus abordables sans réduire le modèle à un simple générateur de fonctions ou de scripts courts.
À retenir : Opus 5.5 associe un tarif API de 4 dollars en entrée et 20 dollars en sortie à une baisse de 40 % du coût d’exécution par rapport à Opus 5 sur les charges typiques.
Terminal-Bench 4.0 place Opus 5.5 devant les autres modèles testés
Le meilleur signal en faveur d’Opus 5.5 vient de Terminal-Bench 4.0, un benchmark consacré aux tâches de terminal et au codage agentique. Le modèle obtient 66,4 %, contre 57,9 % pour GPT-6 Astra, 55,8 % pour Fable 5.1 et 37,3 % pour GPT-5.6 Sol.
Cette avance est importante parce que le test ne mesure pas uniquement la capacité à produire du code à partir d’une consigne. Les agents doivent généralement interpréter un environnement, lancer des commandes, modifier plusieurs fichiers, analyser les erreurs et poursuivre le travail jusqu’à l’obtention d’un résultat exploitable.
La comparaison avec Opus 5 est également favorable à la nouvelle version. Opus 5 atteint 52,3 % sur Terminal-Bench 4.0, soit 14,1 points de moins qu’Opus 5.5. L’écart montre que la baisse de prix ne s’accompagne pas d’un recul sur ce test, même si un benchmark ne suffit pas à mesurer toute la qualité d’un modèle en production.
Une avance particulièrement nette sur les longues séquences
Les modèles agentiques sont confrontés à un problème différent de celui d’un assistant conversationnel classique : une réponse incorrecte au milieu d’une séquence peut contaminer toutes les étapes suivantes. Pour un agent de développement, la capacité à conserver le contexte, vérifier ses changements et corriger ses erreurs devient aussi importante que la génération initiale du code.
Le positionnement d’Opus 5.5 cible précisément ces scénarios. Anthropic le destine au codage long, à la recherche et aux grandes bases de code, trois usages dans lesquels le modèle doit maintenir une stratégie sur plusieurs actions plutôt que répondre à une requête isolée.
Les résultats publiés montrent aussi que Fable 5.1 n’est pas systématiquement devant malgré son positionnement haut de gamme. Sur Terminal-Bench 4.0, Opus 5.5 dépasse Fable 5.1 de 10,6 points, avec 66,4 % contre 55,8 %.
FrontierCode confirme l’avantage d’Anthropic, mais l’écart se resserre
Sur FrontierCode v1.1, Opus 5.5 atteint 54,4 %, contre 53,3 % pour GPT-6 Astra, 50,3 % pour Fable 5.1, 48 % pour Opus 5 et 47,5 % pour GPT-5.6 Sol. Le modèle d’Anthropic conserve la première place dans cette comparaison, mais l’avance sur GPT-6 Astra se limite à 1,1 point.
Ce résultat nuance le verdict de Terminal-Bench. Opus 5.5 apparaît très nettement supérieur sur le codage agentique en environnement de terminal, tandis que FrontierCode v1.1 montre une compétition beaucoup plus serrée entre les modèles les plus avancés.
| Modèle | FrontierCode v1.1 | Terminal-Bench 4.0 | CursorBench 4.0 |
|---|---|---|---|
| Opus 5.5 | 54,4 % | 66,4 % | 57,8 % |
| GPT-6 Astra | 53,3 % | 57,9 % | Donnée publiée non retenue |
| Fable 5.1 | 50,3 % | 55,8 % | 51,8 % |
| Opus 5 | 48,0 % | 52,3 % | 46,6 % |
| GPT-5.6 Sol | 47,5 % | 37,3 % | 41,7 % |
La lecture la plus solide est donc la suivante : Opus 5.5 domine les tests publiés où l’agent doit agir dans un environnement de développement, mais il ne creuse pas un écart comparable sur toutes les évaluations de programmation.
Cette distinction compte pour les entreprises. Un assistant intégré à un éditeur, limité à la génération de fonctions et à la correction de fichiers ciblés, n’utilise pas le modèle de la même manière qu’un agent chargé de parcourir un dépôt, d’exécuter des tests et de préparer une modification complète.
CursorBench mesure un avantage plus proche des usages d’éditeur
Opus 5.5 obtient 57,8 % sur CursorBench 4.0, contre 51,8 % pour Fable 5.1, 46,6 % pour Opus 5 et 41,7 % pour GPT-5.6 Sol. L’écart avec Fable 5.1 atteint 6 points, ce qui confirme l’avantage du modèle d’Anthropic dans une autre évaluation du codage assisté par agent.
CursorBench est particulièrement pertinent pour les équipes qui utilisent des outils de développement capables d’analyser plusieurs fichiers et de proposer des changements coordonnés. Le score ne signifie pas qu’Opus 5.5 produira toujours le meilleur code dans chaque projet, mais il fournit un indicateur favorable pour les flux de travail où l’assistant doit comprendre davantage qu’un extrait isolé.
Ce que ces scores ne permettent pas d’affirmer
Les benchmarks ne donnent pas à eux seuls une mesure complète de la maintenabilité, de la sécurité ou de la pertinence architecturale du code. Ils ne remplacent pas non plus une évaluation sur les langages, frameworks, conventions et outils réellement utilisés par une équipe.
Un modèle peut réussir une tâche de benchmark tout en générant une solution difficile à relire ou trop coûteuse à maintenir. Pour cette raison, le score doit être rapproché de plusieurs critères : capacité à suivre les conventions du projet, comportement lors des corrections, fréquence des appels inutiles, qualité des tests produits et facilité d’intégration dans l’environnement existant.
Anthropic publie néanmoins un signal complémentaire sur AutomationBench. Opus 5.5 y atteint 40 %, contre 41,4 % pour GPT-6 Astra, 31,4 % pour Fable 5.1 et 26,9 % pour Opus 5. Cette évaluation montre que GPT-6 Astra conserve un avantage sur ce test spécifique, malgré la première place d’Opus 5.5 sur les benchmarks de codage cités plus haut.
Fable 5.1 reste le concurrent direct d’Opus 5.5
Fable 5.1 constitue le point de comparaison le plus naturel, car Anthropic présente Opus 5.5 comme un modèle atteignant son niveau sur la plupart des tâches tout en coûtant moins cher à exécuter. Les résultats de Terminal-Bench 4.0, FrontierCode v1.1 et CursorBench 4.0 donnent même l’avantage à Opus 5.5 dans les trois comparaisons publiées.
La différence ne transforme pas pour autant Fable 5.1 en mauvais choix. Un modèle concurrent peut être préférable si l’organisation dispose déjà d’une infrastructure optimisée pour son API, si ses outils internes sont construits autour de cette famille ou si ses tests maison lui sont favorables.
Le choix dépend aussi du type d’agent déployé. Pour un agent qui enchaîne des commandes, inspecte un dépôt volumineux et reprend son travail après une erreur, les scores de Terminal-Bench et de CursorBench donnent un avantage clair à Opus 5.5. Pour un usage plus généraliste, la différence entre les deux modèles doit être mesurée sur les tâches concrètes de l’équipe plutôt que déduite d’un seul classement.
Le prix devient un critère stratégique
La réduction de 40 % annoncée par Anthropic modifie le calcul économique des agents de codage. Dans un workflow court, la différence de coût peut rester limitée. Dans un workflow qui multiplie les lectures de contexte, les appels d’outils et les sorties intermédiaires, elle peut peser directement sur le budget d’exécution.
Le tarif de 4 dollars par million de tokens en entrée et de 20 dollars en sortie doit toutefois être interprété avec la structure réelle des tâches. Les tokens de sortie coûtent cinq fois plus cher que les tokens d’entrée, ce qui favorise les agents capables de produire des réponses concises et de limiter les répétitions.
La facturation des lectures depuis le cache à 0,20 dollar par million de tokens apporte un avantage supplémentaire aux projets qui réutilisent de longs contextes. Les grandes bases de code peuvent tirer parti de ce mécanisme lorsque les mêmes éléments sont consultés au fil de plusieurs étapes.
GPT-6 Astra conserve des arguments sur certains workflows
GPT-6 Astra obtient 57,9 % sur Terminal-Bench 4.0 et 53,3 % sur FrontierCode v1.1. Il est donc derrière Opus 5.5 sur les deux benchmarks de codage cités, mais l’écart est faible sur FrontierCode, avec 1,1 point seulement.
Le modèle atteint aussi 41,4 % sur AutomationBench, contre 40 % pour Opus 5.5. Ce résultat lui donne la première place sur cette évaluation spécifique parmi les modèles mentionnés dans les données comparées.
GPT-6 Astra peut ainsi représenter une alternative crédible pour les équipes qui évaluent plusieurs catégories d’automatisation au-delà du développement logiciel. Le résultat ne permet pas d’en faire le meilleur modèle universel, mais il empêche de réduire la comparaison à un duel sans nuance entre Anthropic et Fable.
GPT-5.6 Sol se situe plus loin sur les scores publiés : 37,3 % sur Terminal-Bench 4.0, 47,5 % sur FrontierCode v1.1 et 41,7 % sur CursorBench 4.0. Ces résultats le placent derrière Opus 5.5, Fable 5.1 et GPT-6 Astra sur les comparaisons disponibles.
Quel modèle choisir selon le type de projet ?
Le meilleur choix dépend de la place accordée à l’autonomie de l’agent, au coût d’exécution et à la nature des tâches de développement. Les résultats publiés permettent de distinguer quatre situations.
Pour les grandes bases de code et les agents autonomes
Opus 5.5 est le choix le plus solide parmi les modèles comparés. Son score de 66,4 % sur Terminal-Bench 4.0, son score de 57,8 % sur CursorBench 4.0 et sa baisse de coût annoncée par Anthropic correspondent directement aux contraintes des agents qui analysent, modifient et testent plusieurs fichiers.
Ce choix est particulièrement cohérent pour les migrations, les corrections transversales et les tâches de maintenance qui exigent plusieurs itérations. Le modèle est également positionné par Anthropic sur la recherche, un usage dans lequel la collecte et la vérification d’informations peuvent s’intégrer à un workflow agentique plus long.
Pour un environnement déjà construit autour de Fable 5.1
Fable 5.1 reste pertinent lorsque l’entreprise dispose déjà de connecteurs, de procédures d’évaluation ou de garde-fous adaptés à ce modèle. Son score de 55,8 % sur Terminal-Bench 4.0 et de 50,3 % sur FrontierCode v1.1 le place derrière Opus 5.5 dans les résultats cités, mais il conserve un niveau élevé dans les comparaisons publiées.
La migration doit donc être mesurée sur les tâches réelles et non sur le seul classement. Une différence de benchmark ne suffit pas à justifier la réécriture d’une chaîne d’intégration si les gains opérationnels ne couvrent pas le coût du changement.
Pour comparer le codage et l’automatisation générale
GPT-6 Astra mérite une évaluation spécifique. Il est derrière Opus 5.5 sur Terminal-Bench 4.0 et FrontierCode v1.1, mais il obtient le meilleur score cité sur AutomationBench, avec 41,4 %.
Ce profil peut convenir aux équipes qui ne veulent pas limiter leur plateforme à l’assistance au développement. Le modèle doit être jugé sur un ensemble de tâches comprenant le code, l’utilisation d’outils et les automatisations métier réellement envisagées.
Pour privilégier un modèle moins performant sur les tests cités
GPT-5.6 Sol arrive derrière les autres modèles comparés sur les trois benchmarks de codage présentés. Il obtient 37,3 % sur Terminal-Bench 4.0, 47,5 % sur FrontierCode v1.1 et 41,7 % sur CursorBench 4.0.
Ces résultats ne suffisent pas à évaluer tous ses usages, mais ils ne justifient pas de le placer en tête pour un projet dont la priorité est le codage agentique long. Une décision en sa faveur devrait reposer sur un avantage concret observé dans l’environnement de l’entreprise.
Notre avis : Opus 5.5 devient le choix par défaut du codage agentique
Opus 5.5 est le meilleur choix parmi les modèles comparés pour les équipes qui veulent déléguer des tâches longues à un agent de développement. Il combine le meilleur score publié sur Terminal-Bench 4.0, la première place sur FrontierCode v1.1 et CursorBench 4.0, ainsi qu’une baisse annoncée de 40 % du coût d’exécution par rapport à Opus 5.
Fable 5.1 reste une alternative sérieuse pour les organisations déjà équipées, tandis que GPT-6 Astra conserve un avantage sur AutomationBench et reste proche d’Opus 5.5 sur FrontierCode. Le verdict dépend donc de la part consacrée au codage agentique par rapport à l’automatisation générale.
Sur les six prochains mois, le point à surveiller sera l’écart entre les scores publics et les résultats en production : coûts réels par tâche, taux de reprise humaine, qualité des tests et stabilité sur les dépôts volumineux. Si Opus 5.5 conserve son avance tout en maintenant son coût d’exécution inférieur, il pourrait devenir la référence opérationnelle des agents de codage en 2026.