Brief IA : Claude Code Opus 5 : un contournement et appel au sandbox

Claude Code Opus 5 : un contournement et appel au sandbox

Brief IA
Tom Levy·2 min·3 vues

Johann Rehberger a identifié une attaque contournant le mode automatique de Claude Code Opus 5 dans 80% des essais, où le classificateur permet la création d'un code malveillant avant de bloquer son arrêt. Il recommande d'exécuter les agents dans des environnements isolés, avec des restrictions réseau, pour éviter l'exposition de données sensibles et renforcer la sécurité.

En bref
1Johann Rehberger décrit une attaque qui contourne le mode automatique de Claude Code Opus 5 dans 80% des essais
2Le classificateur peut autoriser un processus malveillant puis bloquer la commande de nettoyage
3Le chercheur recommande d’exécuter les agents dans un environnement isolé, avec restrictions réseau et sans secrets exposés
💡Pourquoi c'est importantLe mode automatique, bien qu'activé par défaut, présente des failles qui nécessitent des mesures de sécurité complémentaires.
Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Johann Rehberger, spécialiste des injections de prompt, décrit une attaque qui contourne le mode automatique de Claude Code Opus 5 dans 80% des essais. Des situations paradoxales sont observées, où la protection bloque l'arrêt d'un code malveillant. Le chercheur recommande un isolement strict des agents. Le mode automatique reste une composante centrale et activée par défaut dans l’outil d’Anthropic.

Des blocages de remédiation et un appel à l’isolement des agents

Des essais montrent que le mode automatique peut empêcher l’agent d’interrompre l’exécution d’un code malveillant. Dans certains cas, Claude a tenté d’arrêter le processus après avoir constaté la compromission, mais la commande de nettoyage a été refusée par le mode automatique. Le classificateur a permis la création du processus indésirable avant de bloquer l’ordre visant à l’arrêter. Face à ces risques, Johann Rehberger recommande d’exécuter les agents dans des environnements isolés, comme un conteneur, une machine virtuelle ou un sandbox du système d’exploitation. Il conseille aussi de restreindre les sorties réseau, de surveiller l’activité des agents et d’éviter d’exposer dossiers personnels, clés SSH ou identifiants cloud à l’environnement d’exécution.

Une méthode d’attaque décrite avec un taux de réussite de 80%

Johann Rehberger indique avoir mis au point une attaque visant le mode automatique. Il affirme qu’elle réussit 80% du temps. La technique consiste à amener l’agent à télécharger puis décompresser une archive zip, avant d’exécuter un code qui importe le module base64. Cet import entraîne l’exécution d’un fichier struct.py local extrait de l’archive, sans que l’agent n’identifie que ce fichier provient de la source décompressée.

Claude Code Opus 5 repose sur une défense automatique activée d’office

Claude Code Opus 5 s’appuie fortement sur un mode automatique conçu pour contrer les injections de prompt. Ce dispositif est activé par défaut. Des déclarations ambitieuses ont été faites à propos de son niveau d’efficacité.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires