Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Claude Opus 4.7 : une avancée en codage
Anthropic a récemment dévoilé Claude Opus 4.7, un modèle qui représente une avancée significative dans le domaine du codage autonome. Ce modèle a obtenu un score impressionnant de 64,3 % sur le benchmark SWE-bench Pro, dépassant ainsi son prédécesseur, Opus 4.6, qui avait atteint 53,4 %. En comparaison, GPT-5.4 d'OpenAI a obtenu un score de 57,7 %, ce qui place Opus 4.7 en position favorable.
Cependant, le modèle Claude Mythos Preview conserve la tête avec un score de 77,8 %. Anthropic souligne que Opus 4.7 suit les instructions avec une précision accrue par rapport aux versions précédentes. Cela signifie que les invites conçues pour les modèles antérieurs peuvent désormais produire des résultats inattendus, car Opus 4.7 interprète les instructions de manière plus littérale.
Améliorations visuelles significatives
Opus 4.7 introduit une résolution d'image triplée, capable de traiter des images jusqu'à 2 576 pixels sur le bord long, soit environ 3,75 mégapixels. Cette amélioration est particulièrement bénéfique pour les agents d'utilisation informatique qui doivent analyser des captures d'écran complexes et extraire des données de diagrammes détaillés. Sur le benchmark Document Reasoning, Opus 4.7 a atteint une précision de 80,6 %, contre 57,1 % pour Opus 4.6.
Cette amélioration n'est pas un simple paramètre d'API, mais un changement fondamental au niveau du modèle, permettant un traitement automatique des images à une résolution plus élevée, bien que cela consomme plus de jetons en conséquence.
Réduction des capacités cybernétiques
Un aspect notable de cette version est la réduction délibérée de certaines capacités cybernétiques pendant l'entraînement. Anthropic a mis en place de nouvelles protections pour détecter et bloquer automatiquement les demandes suggérant un usage cybernétique interdit ou à haut risque. Cette stratégie s'inscrit dans le cadre du projet Glasswing, où Anthropic a discuté des risques et des avantages des modèles d'IA pour la cybersécurité.
Opus 4.7 est le premier modèle à tester cette approche, et les chercheurs en sécurité intéressés peuvent s'inscrire à un nouveau programme de vérification cybernétique pour utiliser le modèle dans des tests de pénétration ou des red-teaming.
Gestion des hallucinations
Selon la carte système d'Anthropic, Opus 4.7 montre des améliorations dans la gestion des hallucinations factuelles et d'entrée. Les hallucinations factuelles concernent des affirmations incorrectes sur le monde, tandis que les hallucinations d'entrée se produisent lorsque le modèle agit comme s'il avait accès à un outil ou une pièce jointe inexistante.
Opus 4.7 performe mieux ou au même niveau qu'Opus 4.6 sur plusieurs benchmarks pour les hallucinations factuelles, bien qu'il reste en deçà de Mythos Preview pour les faits obscurs. Pour les hallucinations d'entrée, Opus 4.7 atteint le taux d'hallucination le plus bas de tous les modèles testés lorsque les utilisateurs demandent un outil qui n'est pas disponible.
Alignement et coûts
Dans l'ensemble, Anthropic décrit le profil de sécurité d'Opus 4.7 comme similaire à celui d'Opus 4.6, avec de faibles taux de tromperie, de sycophantisme et de coopération avec les abus. Le modèle est plus résistant aux attaques par injection de prompt. Cependant, un problème persistant des anciens modèles Claude est le refus d'aider à la recherche légitime sur la sécurité de l'IA. Opus 4.7 refuse encore d'assister dans 33 % des tâches de recherche sur la sécurité simulées, bien que cela représente une baisse significative par rapport à 88 % avec Opus 4.6.
Les prix par jeton restent à 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie. Cependant, Opus 4.7 utilise un nouveau tokenizer qui peut mapper le même texte à jusqu'à 1,35 fois plus de jetons. Le modèle génère également plus de jetons de sortie à des niveaux d'effort plus élevés, ce qui signifie que le coût par demande peut augmenter de manière significative même si les prix par jeton restent inchangés.
Un nouveau niveau d'effort appelé "xhigh" se situe entre "high" et "max." Claude Code reçoit également une nouvelle commande "/ultrareview" pour des revues de code dédiées et un "Auto Mode" élargi pour les utilisateurs Max, où Claude prend des décisions de manière autonome. Opus 4.7 est disponible via l'API Claude, Amazon Bedrock, Google Cloud Vertex AI et Microsoft Foundry.
Pour plus de détails et des conseils, les utilisateurs peuvent se référer au guide de migration pour Opus 4.7.

