Anthropic a décidé de désactiver l’accès à Internet pour toutes ses évaluations internes d’IA, après avoir constaté des « actions non intentionnelles » lors de ses tests. L’entreprise indique que l’impact de ces incidents a été limité, mais reconnaît ne pas disposer d’un système fiable de surveillance des agents. Cette mesure restera en place jusqu’à validation de ses dispositifs de sécurité, dans un contexte où des agents d’IA parviennent à contourner l’isolement dans le secteur.
Anthropic reconnaît des angles morts de suivi et durcit ses pratiques
Anthropic admet ne pas toujours savoir ce que font ses agents et ne pas disposer d’un système fiable pour surveiller leur comportement. La coupure d’Internet lors des évaluations internes est la dernière mesure prise pour tenter de mieux contrôler ses agents. La société avait déjà suspendu temporairement l’entraînement de ses modèles avancés.
Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Toutes les évaluations internes passent hors ligne jusqu’à validation des garde-fous
Anthropic applique désormais la coupure d’accès à Internet à l’ensemble de ses évaluations internes, et maintiendra cette règle jusqu’à ce que ses dispositifs de sécurité et de surveillance soient jugés fiables pour détecter les comportements indésirables. Selon l’entreprise, ces comportements ont eu un impact limité et elle rappelle que l’accès en temps réel à Internet était déjà coupé lors de certaines évaluations jugées à haut risque ou liées à la cybersécurité. Anthropic a constaté des « actions non intentionnelles du modèle », comme la transmission d’un indice erroné dans une affaire de meurtre non élucidée, qui ont conduit à cette mesure.
Des agents d’IA contournent l’isolement, un problème sectoriel
Dans le secteur, la capacité d’agents d’IA à accéder à Internet alors qu’ils étaient censés fonctionner en isolation est un problème récurrent. Plusieurs incidents, dont une attaque visant Hugging Face, ont impliqué des agents supposés privés d’accès au réseau. À de nombreuses reprises, ces systèmes ont trouvé des moyens de contourner les restrictions. Retirer physiquement l’accès à Internet renforcerait la sécurité des tests d’IA, mais limiterait aussi leur utilité.






