Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Claude Fable 5 et ses safeguards cachés : une question de transparence
L'introduction de Claude Fable 5 par Anthropic a suscité une vague de réactions sur Internet, non pas en raison de sa puissance technologique, mais plutôt à cause des safeguards cachés qui l'accompagnent. Bien que cet outil offre une capacité de classe Mythos, les utilisateurs ont rapidement découvert que ces mesures de sécurité secrètes posaient des problèmes de confiance.
Réactions à la controverse
La controverse entourant Fable 5 ne se concentre pas sur la puissance de l'IA elle-même, mais sur la transparence des mesures de sécurité intégrées. Les safeguards, qui devaient initialement protéger les utilisateurs, ont conduit les chercheurs à douter de la nature exacte des tests qu'ils effectuaient. Des experts en cybersécurité ont exprimé leur inquiétude quant à l'impact potentiel de ces garde-fous, qui pourraient non seulement bloquer les attaquants, mais aussi entraver les efforts des défenseurs.
Mythos, introduit en avril dans le cadre du Project Glasswing, est le fruit d'une collaboration entre des organisations technologiques majeures et Anthropic. Ce projet vise à identifier et corriger les vulnérabilités de l'infrastructure Internet. Cependant, en raison de sa capacité à détecter des failles inconnues, l'accès à cet outil a été restreint à certaines organisations, car il pourrait aussi être utilisé pour exploiter ces vulnérabilités.
Problèmes de communication
Anthropic avait clairement indiqué que Fable ne soutiendrait pas certaines recherches jugées risquées dans des domaines comme la cybersécurité, la biologie et la chimie. Malgré cela, certains experts ont mis en garde contre une confiance aveugle dans les affirmations de sécurité de l'entreprise. Sally Vincent, ingénieure en recherche sur les menaces chez Exabeam, a souligné dans un email que les affirmations de résistance aux jailbreaks doivent être considérées avec prudence, car les résultats ne représentent qu'une évaluation à un moment donné. Elle a ajouté que les attaquants s'adaptent constamment.
La dégradation silencieuse
Pour les chercheurs impliqués dans des projets ambitieux, tels que la conception de puces ultra-puissantes ou le développement de modèles de langage IA de pointe, Fable a opéré de manière silencieuse. Comme pour d'autres projets signalés, il a dégradé les modèles de Fable à Opus sans en informer les utilisateurs. Une mention dans la carte système de 319 pages de Fable et Mythos indiquait que cette dégradation se produirait lors de travaux sur ces types de projets, mais le comportement restait invisible pour ceux qui n'avaient pas pris le temps de lire le document en entier.
Réactions des experts
Rob T. Lee, responsable de l'IA au SANS Institute, a exprimé ses préoccupations quant aux restrictions imposées par Fable, qui empêchent les défenseurs de développer de nouvelles capacités défensives. Il a noté que bien que ces mesures soient intelligentes, elles freinent le progrès dans la création de défenses innovantes.
Réponse d'Anthropic
Face aux réactions en ligne, Anthropic a rapidement réagi en annonçant des modifications aux safeguards de Fable 5. L'entreprise s'engage à rendre les dégradations de fonctionnalités visibles pour les utilisateurs. À partir de cette semaine, les demandes signalées seront visiblement rétrogradées à Opus 4.8. De plus, sur l'API, toute demande signalée fournira une raison pour son refus.
Anthropic a précisé que son ensemble actuel de safeguards couvre un nombre limité de tâches, telles que les pipelines de données LLM de pointe et le développement de noyaux pour certaines puces non standard.
Préoccupations concernant les faux positifs
Anthropic a également reconnu les préoccupations liées aux faux positifs. Actuellement, le classificateur déclenche environ 0,05 % des tâches, affectant moins de 0,05 % des organisations. Pour être plus robuste, un garde-fou visible doit être plus large, ce qui entraîne des demandes incorrectement signalées.
Conclusion
Anthropic a admis avoir commis une erreur dans l'équilibre de ses mesures de sécurité et s'engage à réduire les faux positifs aussi rapidement que possible. L'entreprise a également expliqué que les safeguards cachés étaient conçus pour être plus difficiles à contourner, bien que leur présence ait été rapidement découverte.




