Brief IA

Anthropic : Claude automatise l’alignement d’IA à 4 $/h

🤖 Models & LLM·Tom Levy·

Anthropic : Claude automatise l’alignement d’IA à 4 $/h

Anthropic : Claude automatise l’alignement d’IA à 4 $/h
Key Takeaways
1Anthropic détaille un système où Claude propose et évalue des correctifs d’alignement, testé sur dix catégories via des bancs publics
2L’entreprise annonce des coûts d’environ 4 $/h, des délais inférieurs à six heures pour dépasser des chercheurs expérimentés, et 85 % d’écart comblé sur la tromperie
3Elle reconnaît toutefois des limites méthodologiques et des points encore à vérifier, pendant que des chercheurs extérieurs restent prudents sur la capacité d’agents à mener une recherche réellement ouverte
💡Why it mattersL’automatisation de la recherche d’alignement pourrait accélérer la sécurisation des modèles d’IA, mais son autonomie scientifique reste débattue.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Anthropic teste un dispositif où Claude propose et éprouve des corrections d’alignement pour d’autres modèles d’IA. L’entreprise revendique des gains de coût et de temps et des résultats chiffrés sur des bancs d’essai publics, mais décrit aussi des limites. Des chercheurs extérieurs restent prudents sur la capacité d’agents à conduire une recherche vraiment ouverte.

Limites reconnues et prudence exprimée par des chercheurs

Anthropic souligne que les dix catégories retenues pour l’évaluation restent étroites face aux problèmes rencontrés en production, et que les biais politiques n’étaient pas couverts. L’entreprise ajoute qu’il faut encore vérifier la persistance des corrections après un entraînement par renforcement. Malgré cela, ses chercheurs voient dans les résultats une preuve précoce d’une faisabilité à court terme de l’alignement automatisé post-entraînement. En parallèle, des voix académiques se montrent circonspectes. Sayash Kapoor, de Princeton, rapporte qu’une étude publiée le 18 août n’a pas observé d’agents menant de la recherche ouverte de façon autonome, notant l’abandon prématuré de pistes prometteuses et l’ignorance de retours externes. Les auteurs de cette étude précisent toutefois n’avoir examiné que deux articles rédigés par des agents et reconnaissent une part de subjectivité dans leur protocole. Najoung Kim, de Boston University, exprime également des réserves à propos de la capacité des IA à mener une recherche réellement ouverte. Jack Clark, cofondateur d’Anthropic, écrit quant à lui qu’il reste encore plus sceptique, évoquant un déficit de créativité qui, selon lui, rend improbable une auto-amélioration très rapide à court terme.

Claude réduit de 85 % les risques de tromperie sur les bancs d’essai

Sur la catégorie de la tromperie, Anthropic indique que Claude comble 85 % de l’écart de sécurité mesuré, contre 20 % pour une intervention humaine de référence. Les méthodes dégagées par Claude garderaient en outre leur efficacité sur des modèles 4,7 fois plus grands que ceux ayant servi à l’entraînement. Lors d’un test à grande échelle, Claude Sonnet 5 a été utilisé pour aligner un modèle Opus 4.8 encore en développement en 60 heures, avec 65 % de l’écart réduit grâce à 2 000 exemples d’entraînement, ce qui représente environ 15 000 fois moins que ce qu’exige une méthode conventionnelle. Anthropic précise également avoir utilisé son approche sur 10 questions d’alignement différentes, observant à chaque fois une diminution notable de l’écart de sécurité.

Coûts, délais et périmètre des essais annoncés

La démarche a été testée sur dix familles de défaillances d’alignement, incluant la tromperie et la protection de la vie privée, au moyen de bancs d’essai publics comme Petri et ConfAIde. Anthropic avance un coût d’environ 4 dollars l’heure de calcul pour faire tourner ce dispositif, à comparer aux 150 dollars estimés pour une heure de travail d’un chercheur humain. Selon l’entreprise, la meilleure proposition générée par Claude tend à surpasser celles de chercheurs expérimentés en moins de six heures.

Boucle expérimentale et garde-fous techniques

La boucle d’exploration impose à Claude de s’appuyer sur la littérature scientifique, de proposer une méthode, de l’entraîner pendant trente minutes, puis de la retenir ou non au vu de son efficacité. Un agent de surveillance examine chaque proposition avant application et bloque des tentatives de triche, telles que l’extraction de réponses attendues des jeux d’évaluation. Un système a été conçu où Claude conçoit et teste des correctifs d’alignement pour d’autres modèles d’IA, et Anthropic affirme que ces approches font mieux que celles de chercheurs humains expérimentés.

Pilotage du projet et automatisation plus large chez Anthropic

Les travaux sont dirigés par Chen Yueh-Han dans le cadre du programme Anthropic Fellows, et le système est nommé Automated Alignment Researcher. En dehors de l’alignement, un document interne fait état de plus de 80 % du code d’Anthropic produit par Claude, alors que cette proportion était inférieure à 5 % avant février 2025. Au mois d’avril, Anthropic indique que des agents Claude ont trouvé une solution à un problème ouvert de sécurité de l’IA en totalisant 800 heures de calcul, atteignant un taux de réussite de 97 %, tandis que deux chercheurs humains n’ont obtenu que 23 % en une semaine.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.