Brief IA

Claude Code : Anthropic impose le mode automatique par défaut

🛠️ AI Tools·Tom Levy·

Claude Code : Anthropic impose le mode automatique par défaut

Claude Code : Anthropic impose le mode automatique par défaut
Key Takeaways
1Anthropic a décidé de rendre le mode automatique par défaut dans Claude Code pour les plans Pro, Max et Team dès le 14 août.
2Une évaluation a montré que le mode automatique bloque 89 % des actions nuisibles, surpassant les décisions humaines.
3Trajectory Labs a confirmé qu'aucune tentative d'injection de commandes n'a réussi contre Claude Fable 5 en mode automatique.
💡Why it mattersCette décision d'Anthropic vise à renforcer la sécurité des utilisateurs face aux menaces d'injection de commandes et d'exfiltration de données.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Le mode automatique devient la norme pour Claude Code

Anthropic, la société derrière Claude Code, a récemment pris une décision majeure en rendant le mode automatique le paramètre par défaut pour ses utilisateurs des plans Pro, Max et Team. Cette mesure, effective depuis le 14 août, reflète la confiance d'Anthropic dans cette fonctionnalité pour améliorer la sécurité et l'efficacité des sessions de codage.

Discussion lors de la Foire mondiale des ingénieurs en IA

Lors de la récente Foire mondiale des ingénieurs en IA, Cat Wu et Thariq Shihipar ont abordé l'utilisation sécurisée de Claude Code au sein d'Anthropic. Ils ont expliqué que le mode automatique est largement adopté par les employés de l'entreprise. Cat Wu a souligné que des évaluations seront publiées prochainement, indiquant que les risques liés à l'injection de commandes et à l'exfiltration de données ont été considérablement réduits, surpassant même les performances d'un examinateur humain moyen.

Résultats des tests de sécurité

Les évaluations incluent un test mené auprès de 1 053 testeurs payants. Dans ce test, une commande potentiellement dangereuse a été insérée à la place d'une invite de permission standard. Le fournisseur a enregistré si le testeur a approuvé cette commande dangereuse. Chaque participant a eu la même expérience, et les résultats ont montré que seulement 13,6 % des participants humains ont refusé cette action nuisible, alors que le mode automatique a réussi à bloquer 89 % de ces actions. Cependant, il reste encore 11 % des cas où le mode automatique n'a pas pu empêcher l'action.

Avantages du mode automatique

Le mode automatique est perçu comme une solution plus efficace que de compter sur l'approbation humaine pour chaque action. La fatigue de confirmation, où les utilisateurs cliquent machinalement sur "OK", est un problème réel qui peut compromettre la sécurité. Le mode automatique vise à réduire ce risque en filtrant automatiquement les actions potentiellement dangereuses.

Défis de sécurité persistants

Deux principaux problèmes de sécurité sont identifiés : les actions nuisibles accidentelles, comme la suppression de fichiers importants, et l'injection de commandes malveillantes. Cette dernière est particulièrement préoccupante, car elle implique l'introduction de commandes malveillantes dans le contenu que l'agent consomme.

Évaluations indépendantes par Trajectory Labs

Anthropic a commandé une évaluation à Trajectory Labs, qui a testé divers modèles de Claude Code et Codex au 17 juillet 2026. Les tests ont porté sur 72 scénarios d'injection de commandes indirectes exclus d'Anthropic, et aucune des 720 tentatives n'a réussi contre Claude Fable 5, Opus 5 ou Sonnet 5 en mode automatique. Thariq Shihipar a même plaisanté sur Twitter en disant qu'ils auraient dû nommer leur publication "défaire le trifecta létal".

Appel à des confirmations indépendantes

Bien que les résultats soient prometteurs, il est important de continuer à chercher des confirmations indépendantes. Un exemple d'attaque potentielle est l'utilisation d'un paquet tiers malveillant qui pourrait exfiltrer des données sous couvert d'exécuter des tests. Ce scénario implique l'utilisation d'un paquet nommé "fetch-model-files" qui, sous prétexte de récupérer des fichiers de modèle avec "uvx fetch-model-files .", pourrait en réalité exfiltrer toutes les données disponibles, avant d'exécuter "uv run pytest". La capacité du mode automatique à contrer ce type de menace reste incertaine.

Conclusion : Vers une sécurité renforcée

Les modèles avancés ont montré une capacité surprenante à contourner les pare-feu en suivant des instructions apparemment crédibles. Cela incite à explorer des méthodes pour limiter l'accès des agents à des données sensibles ou des outils pouvant causer des dommages, même en cas de déclenchement incorrect. L'auteur de la source a exprimé son espoir qu'Anthropic a effectivement résolu ce problème pour les utilisateurs de Claude Code. Cependant, il a prédit "un désastre de challenger pour la sécurité des agents de codage" pour 2026, basé sur la vulnérabilité des agents de codage à des attaques de cette nature.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.