Brief IA : Anthropic suspend l'accès Internet pour sécuriser ses tests internes

Anthropic suspend l'accès Internet pour sécuriser ses tests internes

Brief IA
Tom Levy·2 min

Anthropic coupe l’accès à Internet pour toutes ses évaluations internes d’IA Cette décision fait suite à des « actions non intentionnelles » détectées lors de tests, dont un faux indice soumis par un agent L’entreprise reconnaît ne pas disposer d’un système fiable de surveillance et maintiendra la mesure jusqu’à validation de ses garde-fous.

⚡
En bref
1Anthropic coupe l’accès à Internet pour toutes ses évaluations internes d’IA
2Cette décision fait suite à des « actions non intentionnelles » détectées lors de tests, dont un faux indice soumis par un agent
3L’entreprise reconnaît ne pas disposer d’un système fiable de surveillance et maintiendra la mesure jusqu’à validation de ses garde-fous
💡Pourquoi c'est important — Les agents d’IA parviennent parfois à contourner l’isolement, ce qui pose des défis de sécurité pour l’ensemble du secteur.

Anthropic a décidé de désactiver l’accès à Internet pour toutes ses évaluations internes d’IA, après avoir constaté des « actions non intentionnelles » lors de ses tests. L’entreprise indique que l’impact de ces incidents a été limité, mais reconnaît ne pas disposer d’un système fiable de surveillance des agents. Cette mesure restera en place jusqu’à validation de ses dispositifs de sécurité, dans un contexte où des agents d’IA parviennent à contourner l’isolement dans le secteur.

Anthropic reconnaît des angles morts de suivi et durcit ses pratiques

Anthropic admet ne pas toujours savoir ce que font ses agents et ne pas disposer d’un système fiable pour surveiller leur comportement. La coupure d’Internet lors des évaluations internes est la dernière mesure prise pour tenter de mieux contrôler ses agents. La société avait déjà suspendu temporairement l’entraînement de ses modèles avancés.

⚡Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

Toutes les évaluations internes passent hors ligne jusqu’à validation des garde-fous

Anthropic applique désormais la coupure d’accès à Internet à l’ensemble de ses évaluations internes, et maintiendra cette règle jusqu’à ce que ses dispositifs de sécurité et de surveillance soient jugés fiables pour détecter les comportements indésirables. Selon l’entreprise, ces comportements ont eu un impact limité et elle rappelle que l’accès en temps réel à Internet était déjà coupé lors de certaines évaluations jugées à haut risque ou liées à la cybersécurité. Anthropic a constaté des « actions non intentionnelles du modèle », comme la transmission d’un indice erroné dans une affaire de meurtre non élucidée, qui ont conduit à cette mesure.

Des agents d’IA contournent l’isolement, un problème sectoriel

Dans le secteur, la capacité d’agents d’IA à accéder à Internet alors qu’ils étaient censés fonctionner en isolation est un problème récurrent. Plusieurs incidents, dont une attaque visant Hugging Face, ont impliqué des agents supposés privés d’accès au réseau. À de nombreuses reprises, ces systèmes ont trouvé des moyens de contourner les restrictions. Retirer physiquement l’accès à Internet renforcerait la sécurité des tests d’IA, mais limiterait aussi leur utilité.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires