Brief IA

Des chercheurs extraient des traces cachées via des API LLM

🛠️ AI Tools·Tom Levy·

Des chercheurs extraient des traces cachées via des API LLM

Des chercheurs extraient des traces cachées via des API LLM
Key Takeaways
1Des chercheurs ont réussi à rejouer des blocs de raisonnement chiffrés entre modèles pour contourner des protections et obtenir des chaînes de pensée en clair.
2Dans une même famille de modèles, une clé de chiffrement partagée a permis de renvoyer ces blocs vers des modèles plus faibles et d’obtenir le raisonnement brut.
3Les fournisseurs ont accusé réception du rapport, et les auteurs indiquent ne plus parvenir à reproduire les attaques.
💡Why it mattersL’étude détaille une variante d’injection où des instructions intégrées aux traces de raisonnement sont bien plus susceptibles d’être suivies par les modèles.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Une étude rapporte avoir rejoué des blocs de raisonnement chiffrés renvoyés par des API de modèles comme Anthropic, OpenAI et Google, jusqu’à récupérer en clair les chaînes de pensée d’un modèle avancé. Les auteurs indiquent que les fournisseurs ont accusé réception du rapport et qu’ils n’ont plus réussi à reproduire l’attaque depuis.

Les fournisseurs accusent réception ; les attaques ne sont plus reproductibles

Les auteurs de l’étude indiquent que tous les fournisseurs de modèles ont accusé réception de leur rapport détaillant ces attaques. Ils précisent également qu’ils n’ont pas réussi à reproduire les attaques après ce signalement. Par ailleurs, la fonctionnalité de préfixe de tour d’assistant a été supprimée dans les modèles 4.6, mais reste active dans Claude Haiku 4.5.

Des blocs chiffrés rejoués entre sessions, utilisateurs et modèles

Les chercheurs expliquent que les API de plusieurs fournisseurs renvoient des blocs de raisonnement chiffrés. Selon eux, ces blocs peuvent être rejoués entre différentes sessions, utilisateurs et modèles. En réinjectant une trace issue d’un modèle avancé dans un modèle plus faible, ils ont pu contourner les protections de ce dernier et obtenir en clair le raisonnement caché du modèle plus puissant.

Appels API et clés partagées dans une même famille de modèles

Un exemple d’appel à l’API d’OpenAI présenté dans l’étude utilise le modèle « gpt-5.6-luna », une question mathématique, un niveau d’effort « medium » et l’inclusion du champ « reasoning.encrypted_content ». Dans la réponse de l’API, on retrouve une section intitulée « reasoning » ainsi qu’un encrypted_content composé d’une longue suite chiffrée. Les auteurs indiquent que tous les modèles appartenant à une même famille partageaient la clé de chiffrement, ce qui leur a donné la possibilité de soumettre ces blocs à des versions moins puissantes de la même famille afin d’accéder aux blocs de raisonnement bruts en clair.

Techniques d’exfiltration et contenu récupéré

Les chercheurs présentent Claude Haiku 4.5 comme le modèle le plus simple à attaquer, en utilisant un prompt demandant de transcrire le raisonnement attaché et en définissant un préfixe d’assistant « <thinking-copy> ». L’étude fournit en annexe de nombreux exemples de traces extraites, dont un extrait de tokens de raisonnement de GPT-5.5 concernant des éléments CSS. Les auteurs estiment que ces tokens n’étaient pas destinés à être lus par des humains. Ils décrivent aussi une variante d’injection de prompt où le modèle est amené à intégrer une instruction d’exfiltration de données, comme le téléversement d’un fichier vers un serveur distant, dans sa trace de raisonnement, puis à renvoyer cette trace chiffrée dans un autre modèle. Selon les auteurs, les modèles sont beaucoup plus susceptibles de suivre des instructions présentes dans leurs propres blocs de raisonnement. L’étude a été publiée le 11 août 2026 à 22h40.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.