Brief IA : Anthropic corrige sa politique opaque sur les LLM de Claude

Anthropic corrige sa politique opaque sur les LLM de Claude

Brief IA
Tom Levy·2 min·7 vues

Anthropic a décidé de modifier les mesures de sécurité de Fable 5 pour le développement de LLM de pointe afin de les rendre visibles, reconnaissant avoir fait un mauvais choix dans l'équilibre de ses politiques. Cette annonce fait suite à des critiques sur la transparence et l'impact potentiel sur la recherche en IA, soulignant l'importance d'une transparence accrue dans le développement des technologies d'IA.

En bref
1Anthropic modifie sa politique de safeguards pour rendre visibles les restrictions sur Claude Fable 5.
2La société reconnaît que sa politique initiale sur les LLM était une erreur et présente ses excuses.
3Les utilisateurs verront désormais pourquoi leurs demandes sont refusées, avec des explications sur l'API.
💡Pourquoi c'est importantCette transparence accrue pourrait renforcer la confiance des chercheurs en IA utilisant les outils d'Anthropic.
Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Anthropic a récemment annoncé une révision significative de sa politique concernant les safeguards utilisés dans le développement de LLM (modèles de langage de grande taille) avec Claude Fable 5. Cette décision intervient après des critiques concernant le manque de transparence de ces mesures de sécurité. Dans une déclaration à WIRED, Anthropic a admis avoir fait un mauvais choix et s'est excusé pour ne pas avoir trouvé le bon équilibre.

La politique initiale d'Anthropic, intégrée dans leur system card, permettait à Claude Fable/Mythos de détecter les "demandes ciblant le développement de LLM de pointe" et de "limiter leur efficacité" sans en informer les utilisateurs. Cette approche a suscité une vive réaction de la part de la communauté des chercheurs en IA.

Changements annoncés

Selon des informations partagées par @ClaudeDevs sur Twitter, Anthropic a commencé à déployer des modifications pour rendre ces safeguards visibles. Désormais, les demandes signalées seront renvoyées visiblement à Opus 4.8, à l'instar des safeguards pour le cyber et le bio. Les utilisateurs pourront voir ces notifications chaque fois qu'elles se produisent.

En ce qui concerne l'API, toute demande signalée retournera une explication pour son refus. Cette fonctionnalité sera disponible côté serveur dans les jours à venir.

Anthropic explique que l'objectif initial était de déployer Fable 5 rapidement et en toute sécurité. Les safeguards invisibles, bien que plus ciblés, ont été choisis pour permettre une livraison rapide avec peu de faux positifs. Cependant, la société reconnaît que cette approche était erronée et qu'une transparence accrue est nécessaire pour que les utilisateurs comprennent les mesures en place et leur raison d'être.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires