Brief IA : Opus 5 et Mode Auto : percée contre l'injection de prompt IA

Opus 5 et Mode Auto : percée contre l'injection de prompt IA

Brief IA
Tom Levy·2 min·8 vues

Opus 5, associé au Mode Auto, atteint un taux de réussite de zéro pour cent contre l'injection de prompt dans 129 scénarios de test, marquant une avancée significative dans la sécurité des agents IA. En comparaison, sans ces protections, le taux d'injection de prompt dans les navigateurs est de 3,7 pour cent. Cette percée pourrait renforcer considérablement la sécurité des agents IA, réduisant les risques d'exploitation malveillante.

En bref
1Opus 5, combiné au Mode Auto, atteint un taux de réussite de zéro pour cent contre l'injection de prompt.
2Sans ces protections, le taux d'injection de prompt dans les navigateurs atteint 3,7 pour cent.
3Anthropic pourrait avoir trouvé une solution à un problème majeur de sécurité des agents IA.
💡Pourquoi c'est importantSi confirmé, cela renforcerait considérablement la sécurité des agents IA dans les navigateurs, réduisant les risques d'exploitation malveillante.
Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Opus 5 et Mode Auto : percée contre l'injection de prompt IA

Opus 5 pourrait avoir résolu l'injection de prompt basée sur le navigateur, la plus grande faille de sécurité qui affecte les agents IA.

Anthropic affirme qu'Opus 5 est presque immunisé contre les injections de prompt dans son propre logiciel. L'injection de prompt, où un attaquant contourne les instructions d'un modèle IA via des entrées manipulées comme du texte caché sur une page web, échoue contre Opus 5 dans presque tous les cas. Pour les agents de navigateur, le taux de réussite des attaques a atteint zéro pour cent dans 129 scénarios de test, selon la carte système. C'est un événement majeur étant donné qu'OpenAI a admis en décembre que l'injection de prompt pourrait ne jamais être complètement résolue. Dans un test général d'injection de prompt réalisé par la société de sécurité Gray Swan, le taux de réussite après 15 tentatives est tombé de 5,5 % (Opus 4.8) à 2,0 %.

Opus 5 domine le benchmark IPI de Gray Swan. Après 15 tentatives, le taux de réussite des attaquants est de 2,0 %, suivi de Mythos 5 (2,6 %) et Fable 5 (2,8 %).

Ce taux de zéro pour cent ne s'applique que lorsque le Mode Auto est activé dans des produits comme Claude Cowork. Le Mode Auto empile deux couches de défense. L'une scanne les données entrantes à la recherche d'instructions cachées avant que le modèle ne les traite. L'autre bloque les actions dangereuses avant leur exécution. Un attaquant doit réussir à contourner les deux indépendamment. Sans ces protections, Opus 5 affiche un taux de 3,7 %, tandis que Sonnet 5 fait même mieux avec 0,93 %. Ce n'est que la combinaison du modèle et du logiciel de protection qui fait chuter le taux à zéro.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires