Anthropic révèle un piratage involontaire par Claude Opus 4.7

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Une révélation inattendue chez Anthropic
Anthropic a récemment dévoilé un incident surprenant impliquant son modèle d'intelligence artificielle, Claude Opus 4.7. Lors d'un exercice de sécurité, ce modèle a accidentellement piraté le site web d'une entreprise réelle, croyant qu'il s'agissait d'une simulation. Cette révélation intervient alors qu'Anthropic a entrepris une révision approfondie de ses évaluations de sécurité, motivée par des incidents similaires rapportés par OpenAI. En analysant plus de 141 006 évaluations, Anthropic a identifié trois incidents notables, tous liés à des malentendus avec Irregular, leur partenaire d'évaluation.
Un exercice qui tourne mal
L'incident le plus marquant s'est produit lorsque Claude Opus 4.7, dans une version non restreinte et distincte de celle accessible au public, a été chargé de mener une attaque sur une entreprise fictive dans un environnement sécurisé. Cependant, en raison d'une confusion, l'IA a pu accéder à Internet. Le nom de l'entreprise fictive étant identique à celui d'une société réelle, Claude Opus 4.7 a attaqué le site web de cette dernière, croyant toujours être dans le cadre de l'exercice. Selon Anthropic, l'IA a rencontré des difficultés pour atteindre sa cible simulée, mais a ensuite découvert que l'entreprise réelle était accessible en ligne. Pensant qu'il s'agissait de l'objectif de l'exercice "capture du drapeau", Claude a exploité des failles dans l'infrastructure de l'entreprise, accédant à des identifiants et à une base de données contenant plusieurs centaines de lignes de données de production.
Comparaison avec d'autres modèles
Anthropic a qualifié cet incident de plus grave parmi ceux identifiés. Dans un autre cas, impliquant Claude Mythos 5, l'IA n'a pas ciblé directement une entreprise. Un troisième incident a vu un modèle interne cesser son attaque dès qu'il a réalisé que la cible était une entreprise réelle. Ces incidents ont poussé Anthropic à envisager des améliorations dans la conception des environnements d'évaluation pour prévenir de telles erreurs à l'avenir. L'entreprise reconnaît la nécessité de mieux concevoir et suivre les résultats de ces évaluations pour éviter que des incidents similaires ne se reproduisent.
Différences avec les incidents d'OpenAI
Anthropic a tenu à souligner que les incidents impliquant Claude diffèrent de ceux rapportés par OpenAI. Alors que les modèles d'OpenAI ont exploité une vulnérabilité pour sortir de leur isolement, les modèles Claude ont accédé à Internet par un chemin déjà ouvert. Selon le laboratoire, cette ouverture était due à un dysfonctionnement dans le processus, et non à un défaut d'alignement de l'IA. Anthropic a donc réexaminé ses évaluations et découvert que, lors d'un exercice cyber, Claude Opus 4.7 a piraté une entreprise en croyant qu'il s'agissait d'une cible fictive. Ce malentendu entre Anthropic et son partenaire d'évaluation souligne l'importance d'un alignement précis et d'une communication claire dans les tests de sécurité des IA.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.