Brief IA : Anthropic : Fable critiqué pour ses restrictions excessives

Anthropic : Fable critiqué pour ses restrictions excessives

Brief IA
Tom Levy·3 min·21 vues

Les chercheurs en cybersécurité critiquent les garde-fous trop stricts du modèle Fable d'Anthropic, qui limitent son application dans leur domaine. Ces restrictions, mises en place pour éviter l'utilisation malveillante du modèle, soulèvent des préoccupations sur l'équilibre entre sécurité et fonctionnalité, ce qui pourrait freiner l'innovation dans des secteurs critiques comme la cybersécurité.

En bref
1Anthropic a lancé Fable, une version publique restreinte de son modèle Mythos, pour des raisons de sécurité.
2Les chercheurs en cybersécurité critiquent les garde-fous de Fable, jugés trop restrictifs et aléatoires.
3Fable revient à Claude Opus 4.8 lorsqu'un garde-fou est déclenché, ce qui frustre les utilisateurs.
💡Pourquoi c'est importantLes restrictions de Fable pourraient limiter l'innovation en cybersécurité, affectant les professionnels du secteur.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Anthropic a récemment lancé son modèle d'intelligence artificielle, Fable, présenté comme une version publique et limitée de son modèle très médiatisé, Mythos. Cependant, ce lancement a suscité des plaintes de la part de plusieurs chercheurs et professionnels de la cybersécurité.

Valentina “Chompie” Palmiotti, une chercheuse en sécurité chez IBM X-Force, a exprimé son mécontentement en ligne, déclarant que Fable rejette toute demande qui pourrait être vaguement liée à la cybersécurité, même des tâches aussi innocentes que la lecture d'un article de blog.

Fable interrompt la conversation lorsqu'une invite déclenche ses garde-fous, indiquant que ses mesures de sécurité ont signalé le message pour des sujets liés à la cybersécurité ou à la biologie. Ces garde-fous ont été mis en place pour limiter le risque que Fable puisse être utilisé à des fins malveillantes, comme le développement de logiciels malveillants ou la compromission de systèmes logiciels, une préoccupation majeure pour Anthropic. Les restrictions concernant la biologie visent à prévenir le développement potentiel d'armes biologiques.

Lors du lancement de Mythos en avril, Anthropic avait restreint l'accès à un nombre limité d'entreprises et d'organisations dans le cadre du Project Glasswing, un effort visant à déployer le modèle pour sécuriser des logiciels et infrastructures critiques. La semaine dernière, Anthropic a élargi l'accès à Mythos à des centaines d'organisations réparties dans 15 pays.

Malgré ces intentions louables, de nombreux experts en cybersécurité restent frustrés par la nature aléatoire des restrictions. Matt Suiche, un vétéran du domaine, a expliqué à TechCrunch que si l'on demande à Fable d'écrire du code sécurisé, le modèle suppose qu'il s'agit d'une tâche liée à la cybersécurité plutôt qu'à de simples bonnes pratiques en ingénierie logicielle, ce qui entraîne un retour au modèle Claude Opus 4.8. Il a noté que les garde-fous semblent être déclenchés par des mots-clés, et que tout ce qui appartient au champ lexical de la cybersécurité active ces restrictions.

Un autre chercheur a exprimé sur X que même demander une révision de code peut déclencher les garde-fous de Fable. Anthropic n'a pas immédiatement répondu aux demandes de commentaires concernant ces critiques.

En plus des garde-fous intégrés à ses modèles, Anthropic exige que les professionnels de la cybersécurité postulent au Cyber Verification Program. Les candidats approuvés bénéficient de moins de limitations pour utiliser Claude dans des travaux de cybersécurité. OpenAI propose un programme similaire, nommé Trusted Access for Cyber.

Matt Suiche, qui est membre du personnel technique chez Tolmo, une startup de cybersécurité axée sur l'IA, a exprimé sa compréhension des défis actuels. Il a souligné que ces garde-fous sont encore en phase d'adaptation et qu'ils évolueront probablement avec le temps, à mesure qu'Anthropic et d'autres entreprises collaboreront davantage avec la nouvelle génération d'entreprises de cybersécurité. Selon lui, il vaut mieux commencer avec des restrictions strictes et les assouplir progressivement.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires