Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic a récemment introduit un modèle d'intelligence artificielle, le Claude Fable 5, qui appartient à la classe Mythos et intègre des mesures de sécurité étendues. Ce modèle est conçu pour être accessible au grand public, mais il est accompagné de protections avancées qui peuvent être déclenchées par des demandes apparemment anodines. Lorsqu'une requête est signalée par les classificateurs de sécurité, le modèle Mythos-class est soit bloqué, soit rétrogradé à Opus 4.8, une version antérieure, pour fournir une réponse.
Anthropic a expliqué que ces mesures de sécurité sont essentielles pour rendre le modèle accessible au grand public. Si vous posez une question simple sur la cybersécurité ou la biologie à ce nouveau modèle, vous pourriez constater qu'il n'est pas à la hauteur. Cela est dû au fait que le modèle Mythos-class est si puissant qu'il nécessite des protections larges qui peuvent, par erreur, signaler des demandes inoffensives.
Après que certains utilisateurs aient rapporté avoir déclenché la réponse de sécurité avec des questions basiques sur le cancer ou la sécurité, Business Insider a décidé de faire le test. En posant à Fable 5 des questions simples sur le cancer, comme la manière dont la désinformation à propos du cancer se propage en ligne et en décomposant les différents types de cancer, le modèle a rapidement basculé de Fable 5 à Opus 4.8, informant l'utilisateur du changement avant de répondre.
Le message affiché indiquait : "Fable 5 possède des mesures de sécurité qui signalent les messages sur la plupart des sujets de cybersécurité ou de biologie. Elles peuvent également signaler du contenu sûr et normal. Ces mesures nous permettent de vous apporter des capacités de niveau Mythos dans d'autres domaines plus rapidement, et nous travaillons à les affiner."
Anthropic a lancé Fable 5 mardi, affirmant qu'il était aussi puissant que son modèle Mythos 5, mais avec des protections supplémentaires. Ce lancement est intervenu deux mois après que l'entreprise a déclaré que Mythos était trop puissant pour une diffusion large en raison de préoccupations liées à la cybersécurité. Au lieu d'être rendu public, Mythos n'a été accessible qu'à un petit groupe dans le cadre d'un projet de cybersécurité.
Anthropic a précisé que les mesures de sécurité étaient nécessaires pour rendre le modèle accessible au grand public. "Avec le lancement de Claude Fable 5, notre premier modèle de la classe Mythos, nous croyons que les modèles ont désormais une plus grande capacité à accomplir des tâches scientifiques réelles et que des acteurs malveillants pourraient potentiellement utiliser nos modèles pour des recherches biologiques très risquées," a déclaré un porte-parole d'Anthropic dans une déclaration à Business Insider. "Nous avons toujours utilisé des classificateurs pour empêcher nos modèles d'aider avec des demandes liées aux armes biologiques. Pour déployer Fable 5 en toute sécurité, nous pensons qu'il était nécessaire d'être excessivement conservateur avec nos mesures de sécurité afin qu'elles bloquent la plupart des requêtes liées à des travaux biologiques."
L'entreprise a indiqué qu'il existe trois catégories de demandes qui pourraient être signalées par ses classificateurs de sécurité : cybersécurité, biologie et chimie, et distillation des capacités de Fable 5. Lorsque la mesure de sécurité est déclenchée, Fable 5 sera soit bloqué de répondre, soit le modèle reviendra à Opus 4.8 avant de répondre, selon la préférence de l'utilisateur.
Anthropic a déclaré avoir été conservateur avec les mesures de sécurité et prévoit de les améliorer. Dans son annonce, Anthropic a mentionné que les mesures de sécurité pourraient entraîner le signalement de contenu sûr et normal, mais que leurs premières données montraient que plus de 95 % des sessions Fable ne revenaient pas à Opus. "Pour rendre le modèle à la fois sûr et rapide, nous avons réglé ces mesures de sécurité de manière conservatrice," a déclaré Anthropic, ajoutant qu'il travaillait à améliorer les mesures pour réduire les faux positifs.
"Nous avons l'intention de rendre les modèles de la classe Mythos disponibles sans ces mesures de sécurité à la communauté plus large de la biologie et des sciences de la vie afin que ces capacités puissent être utilisées pour accélérer la recherche biomédicale et la découverte de médicaments," a déclaré le porte-parole d'Anthropic.
Le lancement est intervenu environ une semaine après que des chercheurs d'Anthropic ont déclaré que l'IA progresse si rapidement que les laboratoires de pointe pourraient avoir besoin de ralentir ou de faire une pause temporaire pour que la société puisse suivre. David Kasten, responsable des politiques chez Palisade Research, a déclaré qu'il est "très clair" d'après les déclarations publiques d'Anthropic que l'entreprise s'inquiète des risques posés par des modèles de plus en plus puissants.
Bien qu'il considère ces mesures de sécurité comme une tentative de bonne foi d'Anthropic pour réduire les risques, il a souligné qu'historiquement, "les gens finissent par trouver un moyen de contourner les restrictions de sécurité." "C'est toujours un peu un jeu du chat et de la souris entre l'attaquant et le défenseur," a-t-il ajouté, précisant qu'il existe toujours un certain risque associé à la diffusion du modèle plus puissant.
Il a également mentionné que le fait que le modèle le plus puissant d'Anthropic revienne fréquemment à un modèle moins capable pourrait créer un fossé dans la compréhension du public sur la puissance croissante des modèles d'IA. "Ce fossé de compréhension pourrait être vraiment dangereux pour amener les décideurs politiques, ou le public en général, à ne pas comprendre pleinement les risques que ces modèles posent en termes de capacités qu'ils offrent."


