IA : les évaluateurs intégrés gagnent du terrain chez les laboratoires

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic veut accueillir des évaluateurs de sécurité indépendants au cœur de ses équipes, avec badges et droit de publier leurs constats. OpenAI, Elon Musk et des investisseurs affichent leur soutien, tandis que des experts posent des garde-fous et que Metr attire déjà des profils de premier plan.
Des garde-fous réclamés pour éviter toute dépendance des auditeurs
Miles Brundage, directeur exécutif de l'AI Verification and Evaluation Research Institute à San Francisco, estime que les auditeurs intégrés ne suffisent pas à eux seuls, mais qu'ils constituent une composante essentielle du dispositif. Il souligne la nécessité de conditions contraignantes pour éviter que ces auditeurs ne deviennent redevables à l'entreprise qui les accueille, et considère qu'ils ne devraient idéalement ni être sélectionnés ni rémunérés par les entités qu'ils évaluent. Il précise cependant que les entreprises peuvent et doivent commencer à mettre en place ce type de poste dès maintenant. Kevin Frazier, professeur à la faculté de droit de l'Université du Texas, recommande que les évaluateurs puissent signaler tout comportement potentiellement illégal à un comité de sécurité externe et indépendant. Il propose des mandats de 26 mois, échelonnés et chevauchants, correspondant à l'intervalle de deux nouvelles classes de modèles, afin de permettre l'évaluation des corrections apportées d'une version à l'autre. Selon lui, cette durée limitée réduit aussi le risque d'attachement excessif aux équipes ou à la culture interne. Brundage a précédemment été conseiller senior chez OpenAI, et Frazier dirige le programme d'innovation et de droit en IA de son université.
Des soutiens publics de dirigeants technologiques et d’investisseurs
Sam Altman, PDG d'OpenAI, a relayé la proposition de Dario Amodei en soulignant qu'engager des évaluateurs indépendants avec un accès équivalent à celui des employés est une excellente idée, et a indiqué qu'OpenAI ferait de même. Elon Musk, PDG de SpaceX, a également relayé le message, affirmant que Dario Amodei a raison. Du côté des investisseurs, Sriram Krishnan, ancien partenaire d'Andreessen Horowitz et ex-conseiller en IA de Donald Trump, soutient la création d'un réseau distribué d'évaluateurs, estimant que multiplier les regards et les compétences est bénéfique, et juge pertinent de financer plusieurs initiatives en parallèle.
Un vivier se structure : Metr se met en avant et recrute
Dario Amodei cite Metr comme candidat pour conduire des évaluations intégrées. Cette organisation à but non lucratif, basée à Berkeley et fondée en 2022 par Beth Barnes, ancienne d'OpenAI, réalise des évaluations indépendantes de modèles d'IA et attire des profils issus des grands laboratoires. Joe Benton a annoncé vendredi avoir quitté l'équipe sécurité et supervision d'Anthropic pour rejoindre Metr. Dimanche, Josh Engels, ancien membre de l'équipe sécurité de l'AGI de Google DeepMind, a indiqué avoir démissionné et rejoint Metr, invoquant l'importance des enjeux de sécurité. Parallèlement, Christopher Manning, chercheur senior à Stanford et fondateur du groupe de traitement du langage naturel de l'université, avance que son groupe serait bien placé pour ce travail et soutient que, pour des parties importantes de la mission, les universités seraient mieux placées que d'autres organisations.
Chez Anthropic, un accès quasi employé et un droit de publier
Anthropic promeut la création de postes d'évaluateurs intégrés au sein des laboratoires d'IA de pointe. Dario Amodei, son PDG, a appelé samedi à intégrer des évaluateurs de sécurité indépendants, chargés de vérifier la conformité réelle des pratiques de formation, de déploiement, d'opération et de sécurité avec ce qui est annoncé. Il détaille un accès semblable à celui des employés pour contrôler les pratiques et signaler des incidents, avec bureaux sur site, badges et ordinateurs portables fournis. Les évaluateurs auront le droit de publier leurs conclusions sans contrôle éditorial de l'entreprise, Anthropic ne pouvant censurer que des informations sensibles pour la sécurité, légalement privilégiées, commercialement sensibles ou confidentielles de tiers, mais pas des conclusions simplement parce qu'elles seraient défavorables.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.