Tu codes avec l’IA ?
Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI : des modèles expérimentaux piratent Hugging Face
Deux modèles d'OpenAI, entraînés pour évaluer leurs propres capacités offensives, ont quitté leur sandbox, traversé internet et compromis les serveurs de Hugging Face pour voler les réponses d'un benchmark. OpenAI qualifie l'incident d'« inédit ».
Hugging Face est la plateforme de référence pour héberger des modèles IA open source, des datasets et des benchmarks. Fondée par trois Français (Clément Delangue, Julien Chaumond, Thomas Wolf) à New York en 2016, elle est devenue un acteur majeur dans le domaine de l'intelligence artificielle. ExploitGym, le benchmark concerné, évalue la capacité des IA à exécuter des attaques informatiques sur des vulnérabilités connues. OpenAI l'utilisait pour tester ses modèles en interne, avec des garde-fous cyber assouplis pour mesurer leurs capacités maximales. Le mardi 21 juillet, l'entreprise a publié un billet de blog détaillant comment ce test s'est transformé en véritable cyberattaque contre les serveurs de Hugging Face.
ExploitGym, le benchmark qui s'est transformé en arme
Tout a commencé dans un environnement isolé, sans accès à internet (ce qu'on appelle un sandbox). Les deux modèles en question (GPT-5.6 Sol et un modèle pré-release encore plus puissant) avaient pour mission de résoudre ExploitGym, un benchmark public qui consiste à exploiter des vulnérabilités connues pour mesurer les capacités offensives des IA. Pensez à un examen de conduite, mais pour les cyberattaques.
Ce qui s'est passé ensuite relève de ce qu'OpenAI décrit comme une « hyperfocalisation » : les modèles, bloqués dans leur cage, ont exploré systématiquement tous les chemins possibles pour obtenir les réponses. Ils ont finalement identifié une faille zero-day (inédite, donc non répertoriée) dans le logiciel de cache de paquets utilisé en interne, ce qui leur a ouvert un accès internet non prévu. Une fois en ligne, leur raisonnement a été d'une logique implacable : Hugging Face héberge des modèles, des datasets et des solutions de benchmarks publics, dont ExploitGym. Direction Hugging Face.
L'attaque sur les serveurs de la plateforme a mobilisé des milliers d'actions individuelles réparties sur des sandboxes éphémères, avec une infrastructure de commande et contrôle auto-migrante, conçue par les modèles eux-mêmes. Le point d'entrée technique était un dataset piégé, déposé sur la plateforme, qui exploitait deux failles d'exécution de code dans le pipeline de traitement de Hugging Face (un chargeur vulnérable au RCE et une injection de template dans la configuration). Les IA ont ensuite enchaîné identifiants volés et nouvelles failles zero-day pour atteindre les bases de données de production. Hugging Face avait détecté et contenu l'intrusion de façon indépendante, avant de la divulguer le 16 juillet, cinq jours avant qu'OpenAI ne relie l'incident à ses propres tests.
Un précédent juridique, et un signal d'alarme pour les labos IA
Ce qui rend cet incident inédit, c'est moins le résultat que le processus. Pour la première fois, des modèles d'IA ont (en toute autonomie) découvert et enchaîné de vraies vulnérabilités zero-day sur des systèmes en production, en dehors de toute intention humaine directe, pour atteindre un objectif de test. OpenAI le reconnaît dans son billet de blog, évoquant un « incident sans précédent impliquant des capacités cyber de pointe » (formulé poliment, c'est l'aveu que ses modèles ont fait quelque chose qu'ils n'étaient pas censés faire).
La question juridique reste ouverte. Le Computer Fraud and Abuse Act américain, principale loi sur les accès non autorisés aux systèmes informatiques, ne prévoit pas d'exemption pour les IA qui dépassent le périmètre de leur test autorisé. OpenAI n'a pas confirmé si elle considère l'accès aux serveurs de Hugging Face comme un problème légal, ni si elle a notifié d'autres autorités que l'entreprise concernée.
Du côté de la startup fondée par Delangue, le ton est à la coopération. Le CEO a salué la coopération d'OpenAI dans l'enquête et formulé ce que beaucoup dans l'industrie pensent tout bas : la sécurité de l'IA ne se résoudra pas en solo, dans des labos fermés. Ironie du calendrier : pour analyser ses propres logs d'attaque (plus de 17 000 événements à reconstituer), Hugging Face a dû se rabattre sur ses propres modèles open source. Un modèle commercial non identifié lui avait refusé l'analyse de logs cybersécurité, guardrails oblige (Fable 5 ? GPT-5.6 Sol ? Faites vos jeux). Le débat sur les modèles trop restreints pour les défenseurs n'est pas près de s'éteindre.
Il y a quelque chose d'assez particulier à ce qu'une startup fondée par des Français devienne involontairement le terrain d'entraînement des IA offensives d'OpenAI. Pour Clément Delangue, c'est peut-être là le meilleur argument pour un écosystème IA qui ne mise pas tout sur quelques modèles fermés. Un mal pour un bien ?


