Tu codes avec l’IA ?
Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI affirme avoir stoppé fin juillet une vaste campagne de distillation visant les chaînes de pensée de ses modèles. Des chercheurs relèvent cependant des protections inégales selon les plateformes : mi-septembre, l'extraction fonctionnait encore sur Microsoft Azure contre plusieurs modèles, dont GPT-6 Astra.
Sur Azure, l’extraction a encore marché mi-septembre
Le 13 septembre, des tests menés par des chercheurs ont montré que l’attaque était bloquée sur les API d’OpenAI et d’Anthropic, mais restait possible sur Microsoft Azure. Elle a alors permis d’extraire le raisonnement de chaque modèle d’OpenAI testé, y compris GPT-6 Astra, ainsi que de modèles d’Anthropic jusqu’à Sonnet 5. Une seule tentative suffisait pour obtenir le raisonnement sous forme de texte. Les chercheurs soulignent que les mêmes modèles bénéficient de protections différentes selon la plateforme qui les héberge. Selon leur calendrier, OpenAI n’a ajouté des mesures de protection à l’endpoint Azure qu’à partir du 27 septembre, et l’extraction n’était plus reproductible sur Azure pour les modèles d’Anthropic à partir du 28 septembre. Ils rapportent aussi que GPT-6 Astra avait été lancé sur des plateformes tierces sans protections en place.
Deux vecteurs : déchiffrement croisé et bloc-notes virtuel
Les attaquants ont copié le raisonnement chiffré d’une conversation et l’ont soumis dans une session séparée à un autre modèle pour le déchiffrer et le restituer. Joachim Schaeffer et son équipe expliquent que les fournisseurs envoient ces étapes sous forme de paquets chiffrés avec des clés partagées, réutilisables entre sessions, utilisateurs et modèles d’une même famille. Un modèle plus faible et moins coûteux peut alors servir d’« oracle de déchiffrement » et imprimer mot pour mot les étapes cachées. Un second procédé, présenté publiquement par le développeur Can Bölük, consiste à fournir au modèle un bloc-notes virtuel et à lui demander d’y écrire son raisonnement, lisible par l’utilisateur. Selon les chercheurs, cette méthode a fonctionné sur tous les modèles d’OpenAI testés, ainsi que sur Opus 4.8 et Sonnet 5. Seuls Opus 5, Fable 5 et Fable 5.1 n’ont pas révélé leur raisonnement. La sortie obtenue par cette méthode ressemblait à celle de l’attaque de déchiffrement et serait probablement tout aussi utile pour la distillation.
OpenAI renforce ses défenses et partage ses enseignements
OpenAI crédite les chercheurs et affirme avoir confirmé la réalité des chemins d’attaque décrits, ce qui lui a permis de déployer des contre-mesures plus rapidement. L’entreprise indique avoir banni des comptes frauduleux, renforcé les inscriptions et fermé la possibilité de réutiliser et de lire un raisonnement chiffré ne provenant pas de l’utilisateur. Elle filtre désormais les sorties en continu et les retient si elles risquent de dévoiler des étapes de raisonnement. OpenAI précise avoir partagé ses enseignements via le Frontier Model Forum et des canaux gouvernementaux, tout en reconnaissant que les modèles hébergés par des partenaires doivent bénéficier de protections équivalentes et que le travail n’est pas terminé.
Une campagne massive démantelée fin juillet
OpenAI déclare avoir mis fin à une campagne de distillation adversariale visant à extraire les étapes internes de ses modèles. Dans ce type d’opération, un modèle apprend à partir de la sortie complète d’un autre, y compris ses chaînes de pensée, que l’entreprise considère comme sensibles car elles peuvent contenir des informations écartées des réponses et faciliter la reproduction des capacités. L’activité, apparue à faible volume le 1er juillet, a culminé les 24 et 25 juillet à 16 000 requêtes issues de plus de 4 000 utilisateurs, s’appuyant sur un modèle d’extraction typique. OpenAI rapporte avoir identifié un réseau de plus de 15 000 comptes aux motifs liés et l’avoir fermé au 28 juillet, en précisant qu’il s’agissait de tentatives d’extraction, sans garantir leur réussite.
Attribution partielle et appels à des règles pour les clouds
OpenAI relie un noyau d’activité à des personnes associées à Moonshot AI, développeur du modèle Kimi, tout en précisant qu’il n’est pas établi que l’ensemble des acteurs provienne d’une seule source. Anthropic a récemment signalé des tentatives similaires menées par des entreprises d’IA chinoises. Les chercheurs ont publié une mise à jour indiquant avoir de nouveau réussi à extraire des raisonnements, Joachim Schaeffer insistant sur le fait que sécuriser sa propre API ne suffit pas si des fournisseurs cloud distribuent les mêmes modèles avec des protections moindres. Ils décrivent des correctifs encore fragmentaires, souvent fondés sur un appariement fragile de motifs de requêtes, et parfois déployés avec retard sur les plateformes cloud. Schaeffer demande des protections couvrant chaque type d’attaque et chaque cloud hébergeur. L’équipe va plus loin en soutenant que les clouds qui n’imposent pas des protections équivalentes ne devraient pas pouvoir servir des modèles de raisonnement et prévient que des portes dérobées ouvertes permettraient de contourner des contrôles d’export au niveau API. Des chercheurs rapportent enfin que la ruse est restée efficace des semaines sur Azure.






