Claude Code Opus 5 : un contournement et appel au sandbox

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Johann Rehberger, spécialiste des injections de prompt, décrit une attaque qui contourne le mode automatique de Claude Code Opus 5 dans 80% des essais. Des situations paradoxales sont observées, où la protection bloque l'arrêt d'un code malveillant. Le chercheur recommande un isolement strict des agents. Le mode automatique reste une composante centrale et activée par défaut dans l’outil d’Anthropic.
Des blocages de remédiation et un appel à l’isolement des agents
Des essais montrent que le mode automatique peut empêcher l’agent d’interrompre l’exécution d’un code malveillant. Dans certains cas, Claude a tenté d’arrêter le processus après avoir constaté la compromission, mais la commande de nettoyage a été refusée par le mode automatique. Le classificateur a permis la création du processus indésirable avant de bloquer l’ordre visant à l’arrêter. Face à ces risques, Johann Rehberger recommande d’exécuter les agents dans des environnements isolés, comme un conteneur, une machine virtuelle ou un sandbox du système d’exploitation. Il conseille aussi de restreindre les sorties réseau, de surveiller l’activité des agents et d’éviter d’exposer dossiers personnels, clés SSH ou identifiants cloud à l’environnement d’exécution.
Une méthode d’attaque décrite avec un taux de réussite de 80%
Johann Rehberger indique avoir mis au point une attaque visant le mode automatique. Il affirme qu’elle réussit 80% du temps. La technique consiste à amener l’agent à télécharger puis décompresser une archive zip, avant d’exécuter un code qui importe le module base64. Cet import entraîne l’exécution d’un fichier struct.py local extrait de l’archive, sans que l’agent n’identifie que ce fichier provient de la source décompressée.
Claude Code Opus 5 repose sur une défense automatique activée d’office
Claude Code Opus 5 s’appuie fortement sur un mode automatique conçu pour contrer les injections de prompt. Ce dispositif est activé par défaut. Des déclarations ambitieuses ont été faites à propos de son niveau d’efficacité.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.