Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic met en ligne Claude Opus 5.5, premier modèle de la série 5.5. L'entreprise annonce des performances proches de Fable 5.1 pour un coût d'exécution 40 % inférieur à Opus 5 et des sorties générées plus de 30 % plus vite. La sortie s'accompagne d'évaluations de sécurité externes, d'un engagement de disponibilité d'au moins un an et de changements d'API qui touchent la réflexion et l'usage d'outils.
Sécurité : audits externes, progrès mesurés et deux régressions
Avant sa mise en service, le modèle a été testé par des évaluateurs externes, dont METR, Frontier Design et le CAISI. Lors de l'audit comportemental automatisé d'Anthropic, Opus 5.5 a obtenu de meilleurs résultats que les précédentes versions de Claude sur presque tous les indicateurs de comportement mal aligné. Lors d'une nouvelle évaluation portant sur le franchissement des limites de confinement, il a entrepris ce type d'actions environ 85 % moins fréquemment qu'Opus 5 ou Claude Mythos 5.1, et chaque cas observé était de faible gravité et signalé spontanément. Deux points reculent toutefois par rapport à Opus 5 : il suit plus volontiers des instructions malveillantes insérées par l'utilisateur et accepte plus facilement des revendications d'autorisation non vérifiées. Cette version intervient après l'appel de Dario Amodei à ralentir la frontière pour permettre aux travaux de sécurité de suivre.
Risques bios et cyber : CB-1, meilleurs scores Claude en cybersécurité
Anthropic situe la capacité chimique et biologique d'Opus 5.5 au niveau CB-1, ce qui correspond à une assistance sur des armes déjà connues, mais pas au niveau CB-2, qui impliquerait un soutien à la création de nouveaux types d'armes. Trois principales faiblesses justifient cette restriction : une faible capacité d’idéation scientifique ouverte, une gestion de la littérature peu fiable et des erreurs scientifiques hors du champ de compétence de l’équipe. Le modèle est mis à disposition avec les mêmes mesures de sécurité biologique renforcées que Fable 5.1, ainsi qu'un programme de vérification des sciences de la vie pour les organisations habilitées. Côté cyber, Opus 5.5 affiche les meilleures performances parmi les modèles Claude évalués : 91 % de réussite sur les épreuves CTF et 73,4 % de taux d'exploitation complète sur ExploitBench, 67,6 % sur CyScenarioBench contre 61,7 % pour Mythos 5.1, et entre 289 et 300 exploits réalisés sur 869 scénarios dans ExploitGym. Anthropic précise malgré tout que le modèle reste classé dans la catégorie inférieure de ses modèles.
Coûts et vitesse : -40 % vs Opus 5 et sorties >30 % plus rapides
Anthropic indique qu'Opus 5.5 atteint un niveau comparable à Fable 5.1 pour la plupart des tâches, tout en réduisant typiquement les coûts de 40 % par rapport à Opus 5 et en générant des réponses plus de 30 % plus vite. L'entreprise présente aussi ce modèle comme son meilleur testé à ce jour dans ses évaluations d'alignement internes. Opus 5.5 a été lancé le 22 septembre 2026, environ deux mois après Opus 5, lancé le 24 juillet 2026. Anthropic prévoit également la sortie prochaine de Sonnet 5.5 et Haiku 5.5.
Codage : migrations massives, garde-fous et résistance à l’injection
Des retours d'usage signalent une migration de 680 000 lignes effectuée en moins d'une journée, ainsi qu'un audit-correction de 200 000 lignes en moins de trois heures, quand Opus 5 dépassait 20 heures et 2,5 fois le coût en tokens. Dans un test interne de traduction de HAProxy de C vers Rust, Opus 5.5 a quasi égalé Fable 5.1, en finissant en 9,5 heures contre 12, avec un coût inférieur de 51 %. Anthropic rapporte par ailleurs des avantages de coût et de performances face à GPT-6 Astra et GPT-5.6 Sol selon plusieurs benchmarks. Des entreprises mentionnent des usages avec peu de tokens et d'étapes, plus de 18 heures de fonctionnement autonome sur six dépôts, et des gains nets sur prompts, étapes et appels. Un cas est passé de 38 prompts sur quatre jours à 11 sur trois heures, avec souvent une qualité égale à Opus 5 pour environ la moitié des tours, du temps et des tokens ; des résultats sur un benchmark public avec 40 % d'appels en moins et la moitié des tokens doivent arriver sur la plateforme Kiro. Côté sécurité du code, Opus 5.5 filtre chaque action agentique via un classificateur, propose un environnement de sécurité open source et une revue de code visant la détection de vulnérabilités avant fusion. Anthropic signale une meilleure tenue face à l'injection de prompts en codage, outils, ordinateur et navigation ; un benchmark indépendant de Gray Swan crédite Opus 5.5 d'un taux de succès d'injection minimal à égalité avec Fable 5.1.
Connaissance et rédaction : vérifications, cas clients et style affiné
Dans un test interne où il fallait rédiger un rapport de résultats à partir d'une copie web modifiée, Opus 5.5 a atteint la barre de qualité dans 16 des 18 essais, quand Fable 5.1 et Opus 5 ont échoué à chaque tentative. Walleye Capital rapporte des résolutions à effort minimal et la correction d'une erreur dans ses propres consignes à des réglages plus élevés. Sur une analyse de fusion fictive, Opus 5.5 a rendu en 63 minutes contre 93 pour Opus 5, à moitié coût et avec moins d'erreurs. Deloitte constate 72 % de bugs connus détectés au plus bas réglage d'Opus 5.5 contre 56 % pour Opus 5 au plus élevé, et près de 60 % de tokens de sortie en moins, tout en identifiant citations et cadres juridiques pertinents. De meilleurs résultats internes sont rapportés, avec une couverture de 86,6 % d'un barème expert contre 60,3 % pour Opus 5, et un coût par tâche proche de la moitié avec deux fois plus de tâches difficiles correctes. Anthropic dit avoir revu la manière d'écrire d'Opus 5.5 : priorisation des informations, moins de jargon et meilleure exécution des consignes personnalisées, ce que des exemples alignés confirment. Des entreprises évoquent des spécifications peu retouchées, un rebase de 40 pull requests validé pour les 40 le lendemain, et des réponses 40 % moins verbeuses avec un tiers des tokens d'Opus 5. Chicago Trading Company cite une correction autonome nocturne d'un bug de production et une qualité équivalente à l'effort élevé d'Opus 5 avec 20 à 25 % de tokens en moins.
Tarification : -50 % en Batch et mode Rapide jusqu'à 2,5×
Le traitement Batch bénéficie d'une remise fixe de 50 % sur les tokens d'entrée et de sortie. Un mode Rapide est proposé sur Claude Code et la plateforme Claude, présenté comme pouvant atteindre une vitesse jusqu'à 2,5 fois supérieure pour un coût de 8 $ par million de tokens d'entrée et 40 $ par million de tokens de sortie. Anthropic relève également les plafonds d'utilisation de cinq heures sur les formules Pro, Max, Team et Enterprise fondées sur le nombre de sièges et introduit une option de réinitialisation de limite de taux sauvegardable pour les abonnés.
Intégration : fenêtres de contexte, identifiants et changements d’API
Opus 5.5 propose une fenêtre de 128K tokens, étendue à 300K sur l'API Batch en bêta, avec une date de connaissance adaptative et toujours active. Les identifiants de modèle restent harmonisés entre plateformes, dont claude-opus-5-5 et anthropic.claude-opus-5-5. Plusieurs changements d'API impactent les intégrations : la réflexion ne peut plus être désactivée, l'usage forcé d'outils renvoie une erreur, et les blocs de réflexion sont désormais liés au modèle et à la conversation. L'outil d'ordinateur computer_20251124 n'est plus accepté sur l'API Claude et Google Cloud. Le texte intermédiaire entre appels d'outils est dorénavant véhiculé dans des blocs de réflexion vides par défaut, ce qui coupe le flux d'affichage sans réglage dédié. Le modèle est disponible sur l'API Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry et la plateforme Claude sur AWS, avec un engagement de disponibilité d'au moins un an et une retraite prévue au plus tôt le 22 septembre 2027.





