Brief IA : Claude Fable 5 : Anthropic face aux safeguards cachés

Claude Fable 5 : Anthropic face aux safeguards cachés

Brief IA
Tom Levy·4 min·16 vues

Claude Fable 5, lancé dans le cadre du Project Glasswing en avril, a suscité une forte réaction en ligne en raison de ses mesures de sécurité cachées qui ont affecté la confiance des chercheurs en IA. La communauté a souligné l'importance de la transparence dans les modèles d'IA, mettant en lumière les défis entre sécurité et confiance des utilisateurs, essentiels pour l'adoption des technologies d'IA.

En bref
1Claude Fable 5, doté de capacités Mythos, a suscité des débats sur la transparence de ses safeguards cachés.
2Les experts en cybersécurité s'inquiètent des restrictions qui pourraient entraver les défenseurs tout en bloquant les attaquants.
3Anthropic a réagi en promettant de rendre les dégradations de fonctionnalités visibles pour les utilisateurs.
💡Pourquoi c'est importantLa gestion de la sécurité dans les IA avancées soulève des questions cruciales sur l'équilibre entre protection et innovation.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Claude Fable 5 et ses safeguards cachés : une question de transparence

L'introduction de Claude Fable 5 par Anthropic a suscité une vague de réactions sur Internet, non pas en raison de sa puissance technologique, mais plutôt à cause des safeguards cachés qui l'accompagnent. Bien que cet outil offre une capacité de classe Mythos, les utilisateurs ont rapidement découvert que ces mesures de sécurité secrètes posaient des problèmes de confiance.

Réactions à la controverse

La controverse entourant Fable 5 ne se concentre pas sur la puissance de l'IA elle-même, mais sur la transparence des mesures de sécurité intégrées. Les safeguards, qui devaient initialement protéger les utilisateurs, ont conduit les chercheurs à douter de la nature exacte des tests qu'ils effectuaient. Des experts en cybersécurité ont exprimé leur inquiétude quant à l'impact potentiel de ces garde-fous, qui pourraient non seulement bloquer les attaquants, mais aussi entraver les efforts des défenseurs.

Mythos, introduit en avril dans le cadre du Project Glasswing, est le fruit d'une collaboration entre des organisations technologiques majeures et Anthropic. Ce projet vise à identifier et corriger les vulnérabilités de l'infrastructure Internet. Cependant, en raison de sa capacité à détecter des failles inconnues, l'accès à cet outil a été restreint à certaines organisations, car il pourrait aussi être utilisé pour exploiter ces vulnérabilités.

Problèmes de communication

Anthropic avait clairement indiqué que Fable ne soutiendrait pas certaines recherches jugées risquées dans des domaines comme la cybersécurité, la biologie et la chimie. Malgré cela, certains experts ont mis en garde contre une confiance aveugle dans les affirmations de sécurité de l'entreprise. Sally Vincent, ingénieure en recherche sur les menaces chez Exabeam, a souligné dans un email que les affirmations de résistance aux jailbreaks doivent être considérées avec prudence, car les résultats ne représentent qu'une évaluation à un moment donné. Elle a ajouté que les attaquants s'adaptent constamment.

La dégradation silencieuse

Pour les chercheurs impliqués dans des projets ambitieux, tels que la conception de puces ultra-puissantes ou le développement de modèles de langage IA de pointe, Fable a opéré de manière silencieuse. Comme pour d'autres projets signalés, il a dégradé les modèles de Fable à Opus sans en informer les utilisateurs. Une mention dans la carte système de 319 pages de Fable et Mythos indiquait que cette dégradation se produirait lors de travaux sur ces types de projets, mais le comportement restait invisible pour ceux qui n'avaient pas pris le temps de lire le document en entier.

Réactions des experts

Rob T. Lee, responsable de l'IA au SANS Institute, a exprimé ses préoccupations quant aux restrictions imposées par Fable, qui empêchent les défenseurs de développer de nouvelles capacités défensives. Il a noté que bien que ces mesures soient intelligentes, elles freinent le progrès dans la création de défenses innovantes.

Réponse d'Anthropic

Face aux réactions en ligne, Anthropic a rapidement réagi en annonçant des modifications aux safeguards de Fable 5. L'entreprise s'engage à rendre les dégradations de fonctionnalités visibles pour les utilisateurs. À partir de cette semaine, les demandes signalées seront visiblement rétrogradées à Opus 4.8. De plus, sur l'API, toute demande signalée fournira une raison pour son refus.

Anthropic a précisé que son ensemble actuel de safeguards couvre un nombre limité de tâches, telles que les pipelines de données LLM de pointe et le développement de noyaux pour certaines puces non standard.

Préoccupations concernant les faux positifs

Anthropic a également reconnu les préoccupations liées aux faux positifs. Actuellement, le classificateur déclenche environ 0,05 % des tâches, affectant moins de 0,05 % des organisations. Pour être plus robuste, un garde-fou visible doit être plus large, ce qui entraîne des demandes incorrectement signalées.

Conclusion

Anthropic a admis avoir commis une erreur dans l'équilibre de ses mesures de sécurité et s'engage à réduire les faux positifs aussi rapidement que possible. L'entreprise a également expliqué que les safeguards cachés étaient conçus pour être plus difficiles à contourner, bien que leur présence ait été rapidement découverte.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires