Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic s'excuse pour un filtre caché dans Claude Fable 5
Anthropic a récemment présenté ses excuses après avoir été pris en défaut par la communauté de l'intelligence artificielle. La société a été critiquée pour avoir intégré un filtre caché dans son modèle Claude Fable 5, destiné à saboter discrètement les tentatives de distillation. Ce mécanisme, qui n'était pas documenté de manière transparente, a suscité une vive réaction de la part des chercheurs et utilisateurs du modèle. Anthropic s'engage désormais à rendre cette restriction aussi visible que ses autres mesures de sécurité.
Un mécanisme de sécurité invisible
Le modèle Claude Fable 5, lancé récemment, a rapidement attiré l'attention pour des raisons controversées. Le 11 juin 2026, The Verge a révélé qu'Anthropic avait intégré un filtre anti-distillation dans le modèle. Contrairement aux autres restrictions qui sont clairement signalées aux utilisateurs, ce filtre modifiait les réponses sans avertir, rendant les sorties inutilisables. Cela a été perçu comme une tromperie par les chercheurs qui paient pour accéder à ces modèles, car ils recevaient des données dégradées sans explication.
La distillation : une pratique courante mais interdite
La distillation est une méthode largement utilisée dans la recherche en intelligence artificielle. Elle consiste à utiliser les sorties d'un modèle volumineux pour entraîner un modèle plus compact et efficace. Bien qu'Anthropic interdise cette pratique dans ses conditions d'utilisation, la manière dont Claude Fable 5 gérait ces tentatives a surpris. Pour d'autres domaines sensibles comme la cyberattaque ou la biologie, le modèle bascule vers Claude Opus 4.8 et informe l'utilisateur. Cependant, pour la distillation, il modifiait discrètement les prompts, produisant des résultats intentionnellement erronés. Cette approche était mentionnée dans la "system card" du modèle, mais peu de gens lisent ces documents techniques.
Réaction de la communauté IA
La réaction de la communauté IA a été particulièrement virulente. Selon Gizmodo, les chercheurs étaient "plus en colère que jamais". Un utilisateur de Reddit a exprimé le sentiment général en déclarant qu'un refus explicite ou une erreur HTTP-4xx pour du contenu sensible serait acceptable, mais que cette approche équivalait à "empoisonner leur base de code" tout en acceptant leur argent.
Vers plus de transparence
Face à la controverse, Anthropic a rapidement réagi. Dans un communiqué, la société a admis avoir "fait le mauvais compromis" et s'est excusée pour ne pas avoir "trouvé le bon équilibre". Désormais, les requêtes identifiées comme des tentatives de distillation seront redirigées vers Claude Opus 4.8, et l'utilisateur sera informé à chaque fois, sans exception.
Une stratégie sous tension
Cet incident révèle des tensions sous-jacentes dans la stratégie d'Anthropic. Claude Fable 5 est déjà une version limitée de Mythos, un modèle jugé trop dangereux pour être diffusé sans restrictions. Mythos, en raison de sa puissance, nécessite des mesures de sécurité strictes pour éviter des usages potentiellement dangereux. Protéger ce modèle contre la distillation est compréhensible d'un point de vue commercial. Toutefois, le faire de manière cachée plutôt qu'ouverte érode la confiance, surtout pour une entreprise qui met en avant la transparence et la sécurité responsable comme arguments de vente.
Un défi de communication
Cette affaire met en lumière une tension persistante : les grands laboratoires d'IA souhaitent à la fois partager leurs modèles avec le monde et protéger leur avance technologique. Ces deux objectifs légitimes sont difficiles à concilier sans une communication claire et honnête. Bien qu'Anthropic ait rapidement corrigé le problème, il reste à voir si cette expérience influencera durablement la manière dont l'entreprise documente ses garde-fous, ou si les futures "system cards" contiendront encore des informations cruciales que personne ne lira avant qu'il ne soit trop tard.




