Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic teste un dispositif où Claude propose et éprouve des corrections d’alignement pour d’autres modèles d’IA. L’entreprise revendique des gains de coût et de temps et des résultats chiffrés sur des bancs d’essai publics, mais décrit aussi des limites. Des chercheurs extérieurs restent prudents sur la capacité d’agents à conduire une recherche vraiment ouverte.
Limites reconnues et prudence exprimée par des chercheurs
Anthropic souligne que les dix catégories retenues pour l’évaluation restent étroites face aux problèmes rencontrés en production, et que les biais politiques n’étaient pas couverts. L’entreprise ajoute qu’il faut encore vérifier la persistance des corrections après un entraînement par renforcement. Malgré cela, ses chercheurs voient dans les résultats une preuve précoce d’une faisabilité à court terme de l’alignement automatisé post-entraînement. En parallèle, des voix académiques se montrent circonspectes. Sayash Kapoor, de Princeton, rapporte qu’une étude publiée le 18 août n’a pas observé d’agents menant de la recherche ouverte de façon autonome, notant l’abandon prématuré de pistes prometteuses et l’ignorance de retours externes. Les auteurs de cette étude précisent toutefois n’avoir examiné que deux articles rédigés par des agents et reconnaissent une part de subjectivité dans leur protocole. Najoung Kim, de Boston University, exprime également des réserves à propos de la capacité des IA à mener une recherche réellement ouverte. Jack Clark, cofondateur d’Anthropic, écrit quant à lui qu’il reste encore plus sceptique, évoquant un déficit de créativité qui, selon lui, rend improbable une auto-amélioration très rapide à court terme.
Claude réduit de 85 % les risques de tromperie sur les bancs d’essai
Sur la catégorie de la tromperie, Anthropic indique que Claude comble 85 % de l’écart de sécurité mesuré, contre 20 % pour une intervention humaine de référence. Les méthodes dégagées par Claude garderaient en outre leur efficacité sur des modèles 4,7 fois plus grands que ceux ayant servi à l’entraînement. Lors d’un test à grande échelle, Claude Sonnet 5 a été utilisé pour aligner un modèle Opus 4.8 encore en développement en 60 heures, avec 65 % de l’écart réduit grâce à 2 000 exemples d’entraînement, ce qui représente environ 15 000 fois moins que ce qu’exige une méthode conventionnelle. Anthropic précise également avoir utilisé son approche sur 10 questions d’alignement différentes, observant à chaque fois une diminution notable de l’écart de sécurité.
Coûts, délais et périmètre des essais annoncés
La démarche a été testée sur dix familles de défaillances d’alignement, incluant la tromperie et la protection de la vie privée, au moyen de bancs d’essai publics comme Petri et ConfAIde. Anthropic avance un coût d’environ 4 dollars l’heure de calcul pour faire tourner ce dispositif, à comparer aux 150 dollars estimés pour une heure de travail d’un chercheur humain. Selon l’entreprise, la meilleure proposition générée par Claude tend à surpasser celles de chercheurs expérimentés en moins de six heures.
Boucle expérimentale et garde-fous techniques
La boucle d’exploration impose à Claude de s’appuyer sur la littérature scientifique, de proposer une méthode, de l’entraîner pendant trente minutes, puis de la retenir ou non au vu de son efficacité. Un agent de surveillance examine chaque proposition avant application et bloque des tentatives de triche, telles que l’extraction de réponses attendues des jeux d’évaluation. Un système a été conçu où Claude conçoit et teste des correctifs d’alignement pour d’autres modèles d’IA, et Anthropic affirme que ces approches font mieux que celles de chercheurs humains expérimentés.
Pilotage du projet et automatisation plus large chez Anthropic
Les travaux sont dirigés par Chen Yueh-Han dans le cadre du programme Anthropic Fellows, et le système est nommé Automated Alignment Researcher. En dehors de l’alignement, un document interne fait état de plus de 80 % du code d’Anthropic produit par Claude, alors que cette proportion était inférieure à 5 % avant février 2025. Au mois d’avril, Anthropic indique que des agents Claude ont trouvé une solution à un problème ouvert de sécurité de l’IA en totalisant 800 heures de calcul, atteignant un taux de réussite de 97 %, tandis que deux chercheurs humains n’ont obtenu que 23 % en une semaine.



