Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic a récemment annoncé une révision significative de sa politique concernant les safeguards utilisés dans le développement de LLM (modèles de langage de grande taille) avec Claude Fable 5. Cette décision intervient après des critiques concernant le manque de transparence de ces mesures de sécurité. Dans une déclaration à WIRED, Anthropic a admis avoir fait un mauvais choix et s'est excusé pour ne pas avoir trouvé le bon équilibre.
La politique initiale d'Anthropic, intégrée dans leur system card, permettait à Claude Fable/Mythos de détecter les "demandes ciblant le développement de LLM de pointe" et de "limiter leur efficacité" sans en informer les utilisateurs. Cette approche a suscité une vive réaction de la part de la communauté des chercheurs en IA.
Changements annoncés
Selon des informations partagées par @ClaudeDevs sur Twitter, Anthropic a commencé à déployer des modifications pour rendre ces safeguards visibles. Désormais, les demandes signalées seront renvoyées visiblement à Opus 4.8, à l'instar des safeguards pour le cyber et le bio. Les utilisateurs pourront voir ces notifications chaque fois qu'elles se produisent.
En ce qui concerne l'API, toute demande signalée retournera une explication pour son refus. Cette fonctionnalité sera disponible côté serveur dans les jours à venir.
Anthropic explique que l'objectif initial était de déployer Fable 5 rapidement et en toute sécurité. Les safeguards invisibles, bien que plus ciblés, ont été choisis pour permettre une livraison rapide avec peu de faux positifs. Cependant, la société reconnaît que cette approche était erronée et qu'une transparence accrue est nécessaire pour que les utilisateurs comprennent les mesures en place et leur raison d'être.



