Brief IA

Anthropic teste un chercheur IA d’alignement à 4 $/h

🤖 Models & LLM·Tom Levy·

Anthropic teste un chercheur IA d’alignement à 4 $/h

Anthropic teste un chercheur IA d’alignement à 4 $/h
Key Takeaways
1Anthropic affirme que sa meilleure méthode AAR dépasse en moins de six heures des humains expérimentés.
2L’entreprise chiffre l’AAR à environ 4 $/h d’inférence API contre 150 $/h pour un chercheur humain.
3Les systèmes ont amélioré 10 critères d’alignement sans dégrader les performances globales, sous réserve de critères bien définis.
💡Why it mattersAnthropic présente des résultats préliminaires suggérant qu’un alignement automatisé après entraînement pourrait être praticable à court terme, avec des gains de coût et de vitesse annoncés.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Anthropic détaille un « chercheur » automatisé capable d’améliorer un modèle sur dix critères d’alignement définis, sans perte globale de performance. L’entreprise affirme que la meilleure méthode dépasse en moins de six heures ce que proposent des humains expérimentés, pour environ 4 $ d’inférence API par heure contre 150 $ pour un chercheur. Ces résultats restent préliminaires et l’approche dépend de critères bien posés et d’une littérature tenue à jour.

Anthropic revendique mieux que l’humain en moins de six heures

Anthropic compare son Chercheur d’Alignement Automatisé (AAR) à un équivalent humain. Selon l’entreprise, la meilleure méthode AAR dépasse ce que proposent en moyenne des humains expérimentés en moins de six heures. Elle précise que les directions de recherche guidées par des humains n’apportent pas de meilleures performances. Sur le plan financier, Anthropic estime le coût d’un AAR à environ 4 dollars par heure d’inférence API, contre 150 dollars par heure pour un chercheur humain. L’entreprise considère ces résultats comme des preuves préliminaires que l’alignement automatisé après entraînement pourrait devenir praticable à court terme.

Un pipeline automatisé qui itère 30 minutes par méthode

Le système, dirigé par le boursier Chen Yueh-Han, s’inspire des méthodes de recherche traditionnelles : il explore la littérature existante, propose une méthode, puis entraîne le modèle en appliquant cette méthode pendant 30 minutes, en augmentant progressivement le critère ciblé au fil des itérations. Les méthodes efficaces sont conservées, les autres écartées, ce qui permet au système de fonctionner rapidement et à grande échelle. Face à dix critères de comportements mal alignés, les systèmes automatisés ont amélioré les performances sur chacun d’eux sans dégrader les performances globales. Ces résultats ont été présentés vendredi dans un article intitulé « Automated researchers can reliably mitigate alignment failures », qui décrit la capacité de ces systèmes à améliorer de manière fiable des critères d’alignement prédéfinis. Un chercheur du programme de bourses d’Anthropic a ainsi fourni un premier aperçu appliqué de cette approche.

Vers l’auto-amélioration récursive, sous contraintes de critères

L’efficacité de l’automatisation dépend de la pertinence des critères choisis pour refléter les objectifs d’alignement : il est nécessaire de les définir, de les établir et de les maintenir. Anthropic souligne aussi l’importance de conserver et d’élargir la littérature sur laquelle s’appuient ces chercheurs automatisés. Ce travail est présenté comme une étape vers l’auto-amélioration récursive, une perspective souvent considérée comme significative pour l’évolution de l’IA, alors que former des modèles d’IA avec d’autres modèles devient un objectif populaire. Si les modèles parvenaient à améliorer leur propre entraînement à l’alignement, ils pourraient influencer plus largement les pratiques d’entraînement, jusqu’à rendre potentiellement obsolètes les chercheurs humains en IA, une hypothèse encore spéculative.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.