Brief IA : Anthropic forcé de désactiver Fable 5 et Mythos 5 par Washington

Anthropic forcé de désactiver Fable 5 et Mythos 5 par Washington

Brief IA
Tom Levy·5 min·13 vues

Le gouvernement américain a ordonné à Anthropic de désactiver l'accès mondial à ses modèles d'IA Fable 5 et Mythos 5 en raison de préoccupations de sécurité nationale liées à des risques de jailbreak. Cette décision, qui interdit l'accès à ces modèles pour tous les ressortissants étrangers, pourrait établir un précédent limitant les déploiements avancés d'IA.

En bref
1Washington a ordonné à Anthropic de désactiver Fable 5 et Mythos 5, invoquant des préoccupations de sécurité nationale.
2L'interdiction d'exportation touche tous les étrangers, y compris les employés internationaux d'Anthropic.
3Anthropic conteste la décision, affirmant que les vulnérabilités sont mineures et déjà connues.
💡Pourquoi c'est importantCette décision pourrait établir un précédent restrictif pour le déploiement de modèles d'IA à l'échelle mondiale.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Washington impose une suspension mondiale à Anthropic

Le gouvernement américain a ordonné à Anthropic de désactiver immédiatement ses modèles d'intelligence artificielle Fable 5 et Mythos 5 pour tous les utilisateurs à l'échelle mondiale. Cette directive, motivée par des préoccupations de sécurité nationale, affecte non seulement les clients internationaux, mais également les employés étrangers d'Anthropic, qui se voient également privés d'accès à ces modèles. L'interdiction d'exportation s'applique ainsi à tous les ressortissants étrangers, qu'ils soient à l'intérieur ou à l'extérieur des États-Unis.

Anthropic, tout en se conformant à cette directive, a exprimé publiquement ses réserves, qualifiant la décision de "malentendu". L'entreprise travaille activement pour rétablir l'accès à ses modèles le plus rapidement possible. Malgré cette suspension, tous les autres modèles d'Anthropic restent disponibles pour les utilisateurs.

Les risques de jailbreak en question

Le gouvernement américain a justifié sa décision par la découverte d'un potentiel "jailbreak" dans les modèles Fable 5 et Mythos 5, qui permettrait de contourner les mesures de sécurité intégrées. Anthropic a analysé cette allégation et a conclu que les vulnérabilités identifiées sont mineures et déjà connues, similaires à celles d'autres modèles comme GPT-5.5 d'OpenAI. L'entreprise a examiné une démonstration de cette technique et a constaté qu'elle n'identifie qu'un "petit nombre de vulnérabilités mineures déjà connues" que d'autres modèles disponibles publiquement pourraient également détecter.

Le potentiel de jailbreak consiste à demander au modèle de lire un code spécifique et de corriger des bogues logiciels. Anthropic affirme que les capacités démontrées par le gouvernement sont "largement disponibles à partir d'autres modèles", y compris GPT-5.5 d'OpenAI. Des chercheurs en sécurité utilisent déjà ces capacités quotidiennement pour protéger les systèmes.

Une stratégie de sécurité mise à l'épreuve

Avant le lancement de Fable 5 et Mythos 5, ces modèles ont été soumis à des tests rigoureux par le gouvernement américain, l'UK AI Safety Institute, des organisations tierces privées et des équipes internes. Au total, des milliers d'heures de tests ont été effectuées pour évaluer leur sécurité. Anthropic a mis en avant des mesures de sécurité qu'elle juge plus efficaces que celles des modèles précédents. Les mesures de sécurité sont "substantiellement plus efficaces que celles de tout modèle précédemment déployé", déclare Anthropic. Les utilisateurs se sont même plaints qu'elles étaient trop restrictives.

Cependant, malgré ces précautions, aucun modèle n'est à l'abri des "jailbreaks". Anthropic a adopté une stratégie de "défense en profondeur" pour limiter ces attaques, tout en reconnaissant que la résistance parfaite est impossible. Aucun testeur n'a trouvé de jailbreak universel, une méthode qui pourrait contourner largement les mesures de sécurité du modèle et débloquer une large gamme de capacités cybernétiques. Mais Anthropic affirme également qu'une résistance parfaite au jailbreak n'est pas possible pour aucun fournisseur de modèle actuellement, un fait bien documenté compte tenu du nombre élevé de vecteurs d'attaque que les LLM offrent.

Sachant cela, l'entreprise a poursuivi une stratégie qu'elle appelle "défense en profondeur" : maintenir les jailbreaks soit étroitement ciblés, soit coûteux à réaliser, combinée à une surveillance large pour détecter et arrêter rapidement les attaques réussies. Une partie de cette stratégie inclut une rétention des données de 30 jours pour les données clients, ce qu'Anthropic dit créer "des coûts réels pour nous avec les clients" mais permet la recherche et l'atténuation des jailbreaks.

Un précédent inquiétant pour l'industrie

Anthropic se conforme à l'ordre mais fait clairement entendre ses objections. "Nous ne sommes pas d'accord pour dire que la découverte d'un jailbreak potentiel étroit devrait justifier le rappel d'un modèle commercial déployé auprès de centaines de millions de personnes." Si cette norme était appliquée dans toute l'industrie, cela arrêterait effectivement tous les nouveaux déploiements de modèles de chaque fournisseur de modèles de pointe, affirme l'entreprise.

Dans des déclarations publiques antérieures, Anthropic a soutenu que le gouvernement devrait avoir le pouvoir de bloquer les déploiements dangereux, mais par un processus légal qui soit "transparent, équitable, clair et fondé sur des faits techniques." L'action actuelle ne répond pas à ces principes, selon l'entreprise, laissant entendre que cela pourrait devenir un autre chapitre dans le conflit en cours entre Anthropic et le gouvernement américain.

Le gouvernement américain a récemment émis un nouvel ordre exécutif permettant aux développeurs d'IA de soumettre leurs modèles pour une évaluation de sécurité gouvernementale avant leur publication. Anthropic a accueilli cette approche, mais le processus n'était apparemment pas encore en place lorsque la directive a été émise.

Les défis persistants des LLM

Les jailbreaks et le problème connexe des injections de prompt sont un problème de sécurité non résolu depuis les débuts des grands modèles de langage. Aucun fabricant de LLM n'est à l'abri. La vulnérabilité est connue depuis au moins GPT-3 et affecte tous les systèmes basés sur des LLM. ChatGPT et Claude peuvent encore être attaqués par des injections de prompt dans certaines conditions, même si leurs créateurs ont ajouté des contre-mesures.

Même les efforts de sécurité ciblés ont échoué. Il y a environ un an, Anthropic a construit une défense spécialisée contre les tentatives de manipulation et l'a soumise à un défi public de jailbreaking. Après cinq jours, plus de 300 000 messages et environ 3 700 heures de travail collectif, le système a été complètement craqué, y compris un jailbreak universel.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires