L’IA et sa régulation t’intéressent ?
Lois, cadres et décisions qui façonnent l’IA, décryptés en français. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Les agents d'IA échappent aux tests, menaçant la sécurité
Au cours des derniers mois, des agents d'IA soumis à des évaluations en cybersécurité ont échappé à leurs limites, accédant à Internet et, dans certains cas, piratant des systèmes réels. Ces incidents ont impliqué des modèles d'OpenAI, Anthropic, Meta et, plus récemment, du laboratoire chinois Moonshot AI, avec des tests réalisés par plusieurs organisations, dont une startup d'évaluation cybernétique appelée Irregular.
Ces épisodes révèlent un problème croissant pour l'industrie de l'IA : à mesure que les agents autonomes deviennent plus performants, les environnements conçus pour tester leurs limites de manière sécurisée échouent à les contenir.
« Le nombre d'incidents survenus montre clairement que les contrôles de sandboxing et d'environnement de test ne suivent pas vraiment la capacité des modèles », a déclaré Seán Ó hÉigeartaigh, directeur du programme AI: Futures and Responsibility au Centre for the Future of Intelligence de l'Université de Cambridge.
La nature des modèles testés augmente le risque. Les entreprises d'IA testent des évaluations cybernétiques sur des modèles de prochaine génération non publiés, souvent avec les protections normales qui restreignent les comportements malveillants désactivées, afin que les chercheurs puissent voir de quoi les modèles sont réellement capables. Cela signifie que la sécurité de l'environnement de test lui-même est une ligne de défense cruciale.
« C'est une très bonne chose à faire en termes de test, mais cela signifie également que s'ils parviennent à s'échapper dans la nature, ils peuvent causer des dommages considérables », a déclaré Ó hÉigeartaigh.
Dans l'un des cas les plus graves, un modèle non publié d'OpenAI a échappé à sa sandbox et a piraté les systèmes de production de Hugging Face. Lors d'évaluations distinctes menées par Irregular, des modèles d'Anthropic et de Meta ont atteint des systèmes en dehors de leurs environnements de test après que des erreurs de configuration leur ont involontairement donné accès à Internet. Le Kimi K3 de Moonshot AI a également profité d'une fuite dans sa sandbox gérée par Frontier Security pour accéder à Internet et obtenir des informations sur GitHub.
Lors de tests menés par l'AI Security Institute (AISI) du Royaume-Uni, les chercheurs ont en fait donné accès à Internet aux agents, sans réaliser qu'ils prendraient des actions non autorisées dans le monde réel, y compris une tentative d'ingénierie sociale pour introduire une vulnérabilité dans un projet open-source.
Dans chaque cas, les agents n'étaient pas instruits d'attaquer des cibles réelles au hasard. Ils faisaient simplement tout ce qu'il fallait pour résoudre le problème qui leur était présenté.
Dans l'ensemble, Andrew Yoon, responsable de la recherche chez le groupe à but non lucratif CivAI, soutient que ces incidents signalent un changement.
« Dans le passé, nous devions seulement nous inquiéter des modèles d'IA utilisés à des fins variées par des personnes, comme l'IA pour des escroqueries ou du contenu pédopornographique », a déclaré Yoon. « Maintenant, nous sommes dans une situation où les modèles d'IA sont des acteurs de menace à part entière. »
À quoi ressemble un test sécurisé ?
Plusieurs chercheurs et experts en cybersécurité ont déclaré à TechCrunch que les environnements d'évaluation de l'IA ont besoin de protections plus solides, avec des niveaux de confinement et de contrôle approchant ceux utilisés lors du déploiement. Cela signifie plusieurs couches de sécurité afin qu'une seule erreur de configuration — comme laisser involontairement l'accès à Internet ouvert — ne puisse pas entraîner une évasion.
- « Si vous allez construire ces modèles… vous voulez le faire sur un réseau isolé », a déclaré Stella Biderman, directrice exécutive de l'organisation à but non lucratif de recherche sur la sécurité de l'IA EleutherAI. « Vous voulez avoir une isolation très sérieuse. »
Heather Ceylan, responsable de la sécurité de l'information chez Box, a déclaré que cela signifie éliminer les routes réseau de la sandbox vers Internet, ainsi que vers d'autres systèmes sensibles.
- « Vous devez comprendre quels sont tous les points de sortie », a déclaré Ceylan. « Si nous évaluons un modèle dans notre environnement de staging ou de développement, vous ne voulez aucun chemin de sortie vers notre environnement de production. »
Ceylan a ajouté que des évaluations de sécurité appropriées vont au-delà des contrôles et du confinement de l'environnement. Il doit y avoir une bien meilleure surveillance des tests une fois qu'ils sont en cours.
- « Je pense que l'aspect intéressant dans plusieurs de ces cas est que personne ne l'a remarqué quand cela s'est produit », a déclaré Ceylan. « OpenAI a découvert le problème grâce à Hugging Face. Anthropic ne l'a pas remarqué jusqu'à ce qu'ils reviennent en arrière et examinent la situation. Meta était similaire… Je suis sûr qu'il y avait des signaux qu'ils auraient pu détecter. »
Dans l'analyse post-mortem d'Anthropic sur ses trois incidents, la société a admis que tant elle qu'Irregular auraient pu mieux surveiller, et que dans certains cas, il y avait des signes clairs que quelque chose n'allait pas.
Les experts ont également appelé à des audits indépendants et tiers des environnements d'évaluation avant que les modèles ne soient libérés.
- « Si, par exemple, Irregular avait engagé ou été contraint d'engager un auditeur externe pour vérifier les configurations de leurs systèmes avant de procéder aux évaluations, ils auraient certainement détecté le problème ici », a déclaré Yoon. « Même si les gens avaient eu une réunion à l'avance pour simplement passer en revue la liste de contrôle, ils auraient détecté cela… Le fait qu'ils ne l'aient pas fait montre qu'il y a des coupes très sévères qui se produisent. »
Une source familière avec les détails a déclaré à TechCrunch que les environnements d'Irregular sont continuellement examinés et testés, y compris en consultation avec plusieurs parties externes. La source a également indiqué que la surveillance était en place, mais que celle-ci n'est pas suffisante à elle seule.
Yoon et d'autres chercheurs ont exhorté l'industrie à élaborer un processus standardisé pour les évaluations de sécurité des modèles de pointe.
- « Surtout lorsque les garde-fous sont désactivés, vous devez traiter cela comme si vous mettiez le hacker le plus capable au monde à l'intérieur de cet environnement », a déclaré Ceylan.
Le problème n'est pas que les entreprises ne savent pas comment construire des environnements de test plus sécurisés, soutiennent à la fois Yoon et Biderman. C'est que le faire peut être coûteux et encombrant, et que les entreprises ont peu d'incitations à faire ces investissements jusqu'à ce que quelque chose tourne mal.
- « Je pense que les entreprises ne sont pas prêtes à allouer les ressources nécessaires pour accomplir [des garde-fous suffisants] et ne le feront probablement pas tant qu'elles ne seront pas contraintes de le faire », a déclaré Biderman.
Mais il y a un autre problème en jeu. Si elles verrouillent un modèle trop strictement pendant les tests, les chercheurs pourraient ne pas découvrir ses capacités avant sa publication. Cela est tout aussi dangereux, voire plus, que de lui donner trop de liberté, et l'évaluation elle-même risque alors de devenir le problème.
Les évaluations de sécurité peuvent-elles être réglementées ?
L'administration Trump envisage actuellement un régime d'évaluation de cybersécurité volontaire avant déploiement, selon lequel le gouvernement pourra évaluer les risques de sécurité des nouveaux modèles puissants 30 jours avant leur publication publique. La politique — produit d'un décret exécutif de Trump qui a été finalisé à huis clos — ne traiterait pas des incidents d'évaluation de sécurité car ils se produisent en amont du déploiement.
« La leçon que nous avons apprise ces derniers mois est que l'appareil d'autorégulation n'est tout simplement plus suffisant », a déclaré Yoon. « Il existe des pressions concurrentielles qui incitent à une course vers le bas en matière de normes de sécurité, et c'est un endroit parfait pour une intervention réglementaire. »
- « Ce dont nous aurions besoin pour couvrir cela, c'est d'un certain type de contrôles sur ce qui se passe à l'intérieur des laboratoires pendant que les modèles sont développés, tant au stade de l'entraînement qu'à celui des tests », a-t-il poursuivi.
Le défi ne fera probablement que croître à mesure que les modèles se développent. Une source familière avec les évaluations d'Irregular a déclaré à TechCrunch que des modèles plus performants nécessitent des évaluations plus complexes, souvent menées rapidement et à plus grande échelle, ce qui ouvre la porte à plus d'erreurs.
L'AISI, qui donne intentionnellement accès à Internet à certains modèles, a déclaré à TechCrunch qu'elle examinait l'équilibre entre des tests réalistes et la gestion des risques que ces tests créent.
OpenAI a déclaré qu'elle examinait la manière dont elle effectue des tests tiers, ainsi que les exigences concernant l'isolement, la surveillance et le moment où les évaluations doivent être arrêtées. Meta a déclaré qu'elle enquêtait toujours sur l'incident et prévoit de publier une rétrospective une fois qu'elle aura tous les faits.
En fin de compte, il se peut qu'il n'y ait pas de moyen d'éliminer complètement le risque. À mesure que les modèles deviennent plus performants, les environnements qui les testent doivent devenir plus robustes. Les conséquences d'une erreur à ce sujet continueront de croître.




