Brief IA

Opus 5 et Mode Auto : percée contre l'injection de prompt IA

🛠️ AI Tools·Tom Levy·

Opus 5 et Mode Auto : percée contre l'injection de prompt IA

Opus 5 et Mode Auto : percée contre l'injection de prompt IA
Key Takeaways
1Opus 5, combiné au Mode Auto, atteint un taux de réussite de zéro pour cent contre l'injection de prompt.
2Sans ces protections, le taux d'injection de prompt dans les navigateurs atteint 3,7 pour cent.
3Anthropic pourrait avoir trouvé une solution à un problème majeur de sécurité des agents IA.
💡Why it mattersSi confirmé, cela renforcerait considérablement la sécurité des agents IA dans les navigateurs, réduisant les risques d'exploitation malveillante.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Opus 5 et Mode Auto : percée contre l'injection de prompt IA

Opus 5 pourrait avoir résolu l'injection de prompt basée sur le navigateur, la plus grande faille de sécurité qui affecte les agents IA.

Anthropic affirme qu'Opus 5 est presque immunisé contre les injections de prompt dans son propre logiciel. L'injection de prompt, où un attaquant contourne les instructions d'un modèle IA via des entrées manipulées comme du texte caché sur une page web, échoue contre Opus 5 dans presque tous les cas. Pour les agents de navigateur, le taux de réussite des attaques a atteint zéro pour cent dans 129 scénarios de test, selon la carte système. C'est un événement majeur étant donné qu'OpenAI a admis en décembre que l'injection de prompt pourrait ne jamais être complètement résolue. Dans un test général d'injection de prompt réalisé par la société de sécurité Gray Swan, le taux de réussite après 15 tentatives est tombé de 5,5 % (Opus 4.8) à 2,0 %.

Opus 5 domine le benchmark IPI de Gray Swan. Après 15 tentatives, le taux de réussite des attaquants est de 2,0 %, suivi de Mythos 5 (2,6 %) et Fable 5 (2,8 %).

Ce taux de zéro pour cent ne s'applique que lorsque le Mode Auto est activé dans des produits comme Claude Cowork. Le Mode Auto empile deux couches de défense. L'une scanne les données entrantes à la recherche d'instructions cachées avant que le modèle ne les traite. L'autre bloque les actions dangereuses avant leur exécution. Un attaquant doit réussir à contourner les deux indépendamment. Sans ces protections, Opus 5 affiche un taux de 3,7 %, tandis que Sonnet 5 fait même mieux avec 0,93 %. Ce n'est que la combinaison du modèle et du logiciel de protection qui fait chuter le taux à zéro.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.