Brief IA : IA : les évaluateurs intégrés gagnent du terrain chez les laboratoires

IA : les évaluateurs intégrés gagnent du terrain chez les laboratoires

Brief IA
Tom Levy·4 min·1 vues

Anthropic propose d'intégrer des évaluateurs de sécurité indépendants au sein de ses équipes, soutenus par OpenAI, Elon Musk et d'autres investisseurs. Cette initiative vise à renforcer la crédibilité et la transparence des pratiques de sécurité, alors que des experts recommandent des garde-fous pour éviter toute dépendance des auditeurs vis-à-vis des entreprises qu'ils évaluent.

En bref
1Anthropic propose d'intégrer des évaluateurs de sécurité indépendants avec un accès similaire à celui des employés et la possibilité de publier leurs conclusions.
2OpenAI, Elon Musk et des investisseurs soutiennent cette initiative, tandis que des experts recommandent des garde-fous comme des mandats limités et un canal externe d'alerte.
3Metr, organisation fondée en 2022 par Beth Barnes, attire déjà des profils venus de grands laboratoires et se positionne pour ces missions.
💡Pourquoi c'est importantL'intégration d'évaluateurs indépendants vise à renforcer la crédibilité et la transparence des pratiques de sécurité dans les laboratoires d'IA, alors que les inquiétudes sur les risques liés à l'IA s'intensifient.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Anthropic veut accueillir des évaluateurs de sécurité indépendants au cœur de ses équipes, avec badges et droit de publier leurs constats. OpenAI, Elon Musk et des investisseurs affichent leur soutien, tandis que des experts posent des garde-fous et que Metr attire déjà des profils de premier plan.

Des garde-fous réclamés pour éviter toute dépendance des auditeurs

Miles Brundage, directeur exécutif de l'AI Verification and Evaluation Research Institute à San Francisco, estime que les auditeurs intégrés ne suffisent pas à eux seuls, mais qu'ils constituent une composante essentielle du dispositif. Il souligne la nécessité de conditions contraignantes pour éviter que ces auditeurs ne deviennent redevables à l'entreprise qui les accueille, et considère qu'ils ne devraient idéalement ni être sélectionnés ni rémunérés par les entités qu'ils évaluent. Il précise cependant que les entreprises peuvent et doivent commencer à mettre en place ce type de poste dès maintenant. Kevin Frazier, professeur à la faculté de droit de l'Université du Texas, recommande que les évaluateurs puissent signaler tout comportement potentiellement illégal à un comité de sécurité externe et indépendant. Il propose des mandats de 26 mois, échelonnés et chevauchants, correspondant à l'intervalle de deux nouvelles classes de modèles, afin de permettre l'évaluation des corrections apportées d'une version à l'autre. Selon lui, cette durée limitée réduit aussi le risque d'attachement excessif aux équipes ou à la culture interne. Brundage a précédemment été conseiller senior chez OpenAI, et Frazier dirige le programme d'innovation et de droit en IA de son université.

Des soutiens publics de dirigeants technologiques et d’investisseurs

Sam Altman, PDG d'OpenAI, a relayé la proposition de Dario Amodei en soulignant qu'engager des évaluateurs indépendants avec un accès équivalent à celui des employés est une excellente idée, et a indiqué qu'OpenAI ferait de même. Elon Musk, PDG de SpaceX, a également relayé le message, affirmant que Dario Amodei a raison. Du côté des investisseurs, Sriram Krishnan, ancien partenaire d'Andreessen Horowitz et ex-conseiller en IA de Donald Trump, soutient la création d'un réseau distribué d'évaluateurs, estimant que multiplier les regards et les compétences est bénéfique, et juge pertinent de financer plusieurs initiatives en parallèle.

Un vivier se structure : Metr se met en avant et recrute

Dario Amodei cite Metr comme candidat pour conduire des évaluations intégrées. Cette organisation à but non lucratif, basée à Berkeley et fondée en 2022 par Beth Barnes, ancienne d'OpenAI, réalise des évaluations indépendantes de modèles d'IA et attire des profils issus des grands laboratoires. Joe Benton a annoncé vendredi avoir quitté l'équipe sécurité et supervision d'Anthropic pour rejoindre Metr. Dimanche, Josh Engels, ancien membre de l'équipe sécurité de l'AGI de Google DeepMind, a indiqué avoir démissionné et rejoint Metr, invoquant l'importance des enjeux de sécurité. Parallèlement, Christopher Manning, chercheur senior à Stanford et fondateur du groupe de traitement du langage naturel de l'université, avance que son groupe serait bien placé pour ce travail et soutient que, pour des parties importantes de la mission, les universités seraient mieux placées que d'autres organisations.

Chez Anthropic, un accès quasi employé et un droit de publier

Anthropic promeut la création de postes d'évaluateurs intégrés au sein des laboratoires d'IA de pointe. Dario Amodei, son PDG, a appelé samedi à intégrer des évaluateurs de sécurité indépendants, chargés de vérifier la conformité réelle des pratiques de formation, de déploiement, d'opération et de sécurité avec ce qui est annoncé. Il détaille un accès semblable à celui des employés pour contrôler les pratiques et signaler des incidents, avec bureaux sur site, badges et ordinateurs portables fournis. Les évaluateurs auront le droit de publier leurs conclusions sans contrôle éditorial de l'entreprise, Anthropic ne pouvant censurer que des informations sensibles pour la sécurité, légalement privilégiées, commercialement sensibles ou confidentielles de tiers, mais pas des conclusions simplement parce qu'elles seraient défavorables.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires