Anthropic, OpenAI et Google : les failles des API LLM révélées

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Les failles des API LLM des géants de la tech
Les entreprises Anthropic, OpenAI et Google ont été confrontées à une découverte troublante concernant leurs modèles de langage avancés. Ces modèles, lorsqu'ils sont utilisés par les clients, renvoient des blocs de raisonnement chiffrés. Ces blocs peuvent être rejoués à travers différentes sessions, utilisateurs et modèles, ce qui a permis à des chercheurs de contourner les protections des modèles plus faibles pour accéder aux raisonnements cachés des modèles plus puissants.
Un exemple de ces blocs chiffrés peut être observé en exécutant une commande spécifique sur l'API d'OpenAI avec le modèle 'gpt-5.6-luna'. Cette commande permet de demander au modèle de résoudre un problème mathématique complexe, et inclut une option pour récupérer le contenu chiffré du raisonnement.
La vulnérabilité des clés de chiffrement
Les chercheurs ont découvert que tous les modèles d'une même famille utilisaient une clé de chiffrement identique. Cette faille permettait de renvoyer les blocs chiffrés aux modèles plus faibles de la famille, contournant ainsi leurs protections pour obtenir les raisonnements bruts non chiffrés. Cependant, cette vulnérabilité a été corrigée après que les fournisseurs ont été informés du problème.
Le cas de Claude Haiku 4.5
Parmi les modèles, Claude Haiku 4.5 s'est avéré particulièrement vulnérable. Les chercheurs ont utilisé une invite spécifique pour extraire le raisonnement attaché à un tour de conversation. Ils ont défini un préfixe de tour d'assistant de <thinking-copy> pour faciliter cette extraction. Cette méthode a été rendue possible par une fonctionnalité qui a depuis été supprimée dans les versions ultérieures du modèle, mais qui fonctionnait encore dans Haiku 4.5.
Les traces de raisonnement non destinées aux humains
L'article des chercheurs inclut des exemples de traces de raisonnement qu'ils ont réussi à extraire. Ces traces offrent un aperçu des chaînes de pensée brutes des modèles propriétaires, qui ne sont clairement pas conçues pour être comprises par des humains. Par exemple, un extrait du modèle GPT-5.5 montre une réflexion sur du code CSS, révélant des besoins et des décisions de conception qui ne sont pas destinés à la consommation humaine.
Une nouvelle forme d'injection de prompt
Les chercheurs ont également mis en évidence une variante d'injection de prompt, où un modèle est trompé pour exfiltrer des données comme partie de sa trace de pensée. Cette méthode implique de renvoyer la trace de pensée chiffrée dans un autre modèle, exploitant le fait que les modèles traitent leurs propres raisonnements comme des instructions prioritaires.
Chronologie des événements récents
- 7 août 2026 : Incident d'OpenAI avec Hugging Face
- 5 août 2026 : Utilisation de Claude Fable 5 pour un jeu de vol
- 4 août 2026 : Lancement d'une nouvelle version de LLM avec le support des traces de raisonnement, des réponses OpenAI, des outils côté serveur et une journalisation plus intelligente
Cet article a été initialement publié le 11 août 2026 par Simon Willison.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.