Brief IA : Des chercheurs extraient des traces cachées via des API LLM

Des chercheurs extraient des traces cachées via des API LLM

Brief IA
Tom Levy·3 min·9 vues

Des chercheurs ont réussi à rejouer des blocs de raisonnement chiffrés entre modèles d'IA, permettant de récupérer des chaînes de pensée en clair de modèles avancés comme ceux d'Anthropic, OpenAI et Google. Bien que les fournisseurs aient accusé réception du rapport, les auteurs n'ont pas réussi à reproduire les attaques après ce signalement. Cette étude souligne une vulnérabilité dans l'injection d'instructions intégrées aux traces de raisonnement des modèles.

⚡
En bref
1Des chercheurs ont réussi à rejouer des blocs de raisonnement chiffrés entre modèles pour contourner des protections et obtenir des chaînes de pensée en clair.
2Dans une même famille de modèles, une clé de chiffrement partagée a permis de renvoyer ces blocs vers des modèles plus faibles et d’obtenir le raisonnement brut.
3Les fournisseurs ont accusé réception du rapport, et les auteurs indiquent ne plus parvenir à reproduire les attaques.
💡Pourquoi c'est important — L’étude détaille une variante d’injection où des instructions intégrées aux traces de raisonnement sont bien plus susceptibles d’être suivies par les modèles.
⚡Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Des blocs de raisonnement chiffrés renvoyés par des API de modèles comme Anthropic, OpenAI et Google ont été rejoués jusqu’à ce que les chaînes de pensée d’un modèle avancé soient récupérées en clair. Les fournisseurs ont accusé réception d’un rapport sur cette attaque et n’ont plus réussi à la reproduire depuis.

Les fournisseurs accusent réception ; les attaques ne sont plus reproductibles

Tous les fournisseurs de modèles ont accusé réception d’un rapport détaillant ces attaques. Ils précisent également qu’ils n’ont pas réussi à reproduire les attaques après ce signalement. Par ailleurs, la fonctionnalité de préfixe de tour d’assistant a été supprimée dans les modèles 4.6, mais reste active dans Claude Haiku 4.5.

Des blocs chiffrés rejoués entre sessions, utilisateurs et modèles

Les chercheurs expliquent que les API de plusieurs fournisseurs renvoient des blocs de raisonnement chiffrés. Selon eux, ces blocs peuvent être rejoués entre différentes sessions, utilisateurs et modèles. En réinjectant une trace issue d’un modèle avancé dans un modèle plus faible, ils ont pu contourner les protections de ce dernier et obtenir en clair le raisonnement caché du modèle plus puissant.

Appels API et clés partagées dans une même famille de modèles

Un exemple d’appel à l’API d’OpenAI utilise le modèle « gpt-5.6-luna », une question mathématique, un niveau d’effort « medium » et l’inclusion du champ « reasoning.encrypted_content ». Dans la réponse de l’API, on retrouve une section intitulée « reasoning » ainsi qu’un encrypted_content composé d’une longue suite chiffrée. Tous les modèles appartenant à une même famille partageaient la clé de chiffrement, ce qui a permis de soumettre ces blocs à des versions moins puissantes de la même famille afin d’accéder aux blocs de raisonnement bruts en clair.

Techniques d’exfiltration et contenu récupéré

Les chercheurs présentent Claude Haiku 4.5 comme le modèle le plus simple à attaquer, en utilisant un prompt demandant de transcrire le raisonnement attaché et en définissant un préfixe d’assistant « <thinking-copy> ». De nombreux exemples de traces extraites sont disponibles, dont un extrait de tokens de raisonnement de GPT-5.5 concernant des éléments CSS. Ces tokens n’étaient pas destinés à être lus par des humains. Ils décrivent aussi une variante d’injection de prompt où le modèle est amené à intégrer une instruction d’exfiltration de données, comme le téléversement d’un fichier vers un serveur distant, dans sa trace de raisonnement, puis à renvoyer cette trace chiffrée dans un autre modèle. Selon les auteurs, les modèles sont beaucoup plus susceptibles de suivre des instructions présentes dans leurs propres blocs de raisonnement. L’étude a été publiée le 11 août 2026 à 22h40.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires