Brief IA : Anthropic Claude Opus 4.7 : percée en codage, cybersécurité bridée

Anthropic Claude Opus 4.7 : percée en codage, cybersécurité bridée

Brief IA
Tom Levy·4 min·5 vues

Claude Opus 4.7 d'Anthropic améliore les performances en codage avec un score de 64,3 % sur le benchmark SWE-bench Pro, surpassant GPT-5.4 d'OpenAI à 57,7 %. La société a également réduit délibérément certaines capacités en cybersécurité, ce qui pourrait influencer l'utilisation des modèles d'IA dans des contextes sensibles à la sécurité.

En bref
1Anthropic dévoile Claude Opus 4.7, surpassant son prédécesseur avec un score de 64,3 % sur SWE-bench Pro.
2La résolution d'image triplée améliore l'analyse visuelle, atteignant 80,6 % de précision sur Document Reasoning.
3Les capacités cybernétiques sont volontairement réduites, avec des protections automatiques contre les usages risqués.
💡Pourquoi c'est importantCette stratégie d'Anthropic vise à équilibrer innovation technologique et sécurité, influençant l'avenir de l'IA en cybersécurité.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Claude Opus 4.7 : une avancée en codage

Anthropic a récemment dévoilé Claude Opus 4.7, un modèle qui représente une avancée significative dans le domaine du codage autonome. Ce modèle a obtenu un score impressionnant de 64,3 % sur le benchmark SWE-bench Pro, dépassant ainsi son prédécesseur, Opus 4.6, qui avait atteint 53,4 %. En comparaison, GPT-5.4 d'OpenAI a obtenu un score de 57,7 %, ce qui place Opus 4.7 en position favorable.

Cependant, le modèle Claude Mythos Preview conserve la tête avec un score de 77,8 %. Anthropic souligne que Opus 4.7 suit les instructions avec une précision accrue par rapport aux versions précédentes. Cela signifie que les invites conçues pour les modèles antérieurs peuvent désormais produire des résultats inattendus, car Opus 4.7 interprète les instructions de manière plus littérale.

Améliorations visuelles significatives

Opus 4.7 introduit une résolution d'image triplée, capable de traiter des images jusqu'à 2 576 pixels sur le bord long, soit environ 3,75 mégapixels. Cette amélioration est particulièrement bénéfique pour les agents d'utilisation informatique qui doivent analyser des captures d'écran complexes et extraire des données de diagrammes détaillés. Sur le benchmark Document Reasoning, Opus 4.7 a atteint une précision de 80,6 %, contre 57,1 % pour Opus 4.6.

Cette amélioration n'est pas un simple paramètre d'API, mais un changement fondamental au niveau du modèle, permettant un traitement automatique des images à une résolution plus élevée, bien que cela consomme plus de jetons en conséquence.

Réduction des capacités cybernétiques

Un aspect notable de cette version est la réduction délibérée de certaines capacités cybernétiques pendant l'entraînement. Anthropic a mis en place de nouvelles protections pour détecter et bloquer automatiquement les demandes suggérant un usage cybernétique interdit ou à haut risque. Cette stratégie s'inscrit dans le cadre du projet Glasswing, où Anthropic a discuté des risques et des avantages des modèles d'IA pour la cybersécurité.

Opus 4.7 est le premier modèle à tester cette approche, et les chercheurs en sécurité intéressés peuvent s'inscrire à un nouveau programme de vérification cybernétique pour utiliser le modèle dans des tests de pénétration ou des red-teaming.

Gestion des hallucinations

Selon la carte système d'Anthropic, Opus 4.7 montre des améliorations dans la gestion des hallucinations factuelles et d'entrée. Les hallucinations factuelles concernent des affirmations incorrectes sur le monde, tandis que les hallucinations d'entrée se produisent lorsque le modèle agit comme s'il avait accès à un outil ou une pièce jointe inexistante.

Opus 4.7 performe mieux ou au même niveau qu'Opus 4.6 sur plusieurs benchmarks pour les hallucinations factuelles, bien qu'il reste en deçà de Mythos Preview pour les faits obscurs. Pour les hallucinations d'entrée, Opus 4.7 atteint le taux d'hallucination le plus bas de tous les modèles testés lorsque les utilisateurs demandent un outil qui n'est pas disponible.

Alignement et coûts

Dans l'ensemble, Anthropic décrit le profil de sécurité d'Opus 4.7 comme similaire à celui d'Opus 4.6, avec de faibles taux de tromperie, de sycophantisme et de coopération avec les abus. Le modèle est plus résistant aux attaques par injection de prompt. Cependant, un problème persistant des anciens modèles Claude est le refus d'aider à la recherche légitime sur la sécurité de l'IA. Opus 4.7 refuse encore d'assister dans 33 % des tâches de recherche sur la sécurité simulées, bien que cela représente une baisse significative par rapport à 88 % avec Opus 4.6.

Les prix par jeton restent à 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie. Cependant, Opus 4.7 utilise un nouveau tokenizer qui peut mapper le même texte à jusqu'à 1,35 fois plus de jetons. Le modèle génère également plus de jetons de sortie à des niveaux d'effort plus élevés, ce qui signifie que le coût par demande peut augmenter de manière significative même si les prix par jeton restent inchangés.

Un nouveau niveau d'effort appelé "xhigh" se situe entre "high" et "max." Claude Code reçoit également une nouvelle commande "/ultrareview" pour des revues de code dédiées et un "Auto Mode" élargi pour les utilisateurs Max, où Claude prend des décisions de manière autonome. Opus 4.7 est disponible via l'API Claude, Amazon Bedrock, Google Cloud Vertex AI et Microsoft Foundry.

Pour plus de détails et des conseils, les utilisateurs peuvent se référer au guide de migration pour Opus 4.7.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires