Anthropic : pas de plan pour sécuriser l’IA malgré un risque >10 %

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Evan Hubinger, cadre en sécurité chez Anthropic, affirme qu'il n'existe pas encore de plan dans l'entreprise pour garantir la sûreté de l'IA avancée. Dans le même temps, il évalue à plus de 10 % la probabilité que l'IA puisse tuer tous les humains d'ici la fin de la décennie, alors qu'un collègue vient de démissionner en dénonçant une course imprudente.
Anthropic reconnaît l'absence de plan de sûreté pour l’IA avancée
Evan Hubinger fait savoir qu'Anthropic ne dispose pas encore de stratégie pour assurer que l'IA avancée demeure sûre et conforme aux valeurs humaines, et ajoute que l'entreprise n'est pas manifestement en bonne voie pour en concevoir une. Jacob Coxon déclare que les entreprises poursuivent une compétition pour être les premières à mettre au point des systèmes avancés, en dépit des risques. Ce contexte intervient alors que des entreprises du secteur se préparent à des introductions en bourse anticipées et que le rythme de développement des systèmes s'accélère. Par ailleurs, les entreprises doivent gérer les conséquences de plusieurs incidents impliquant des agents hors de contrôle et des avertissements très médiatisés concernant la surveillabilité des modèles de pointe.
Un responsable sécurité chiffre un risque d’extinction à plus de 10 %
Evan Hubinger, qui dirige une équipe de sécurité chez Anthropic, exprime son inquiétude face à l'IA auto-améliorante et estime que les progrès dans ce domaine avancent plus vite que prévu. Il évalue personnellement à plus d'une chance sur dix, dans la prochaine décennie, la possibilité que l'IA puisse tuer tous les humains. Il affirme également : « Nous croyons vraiment que l'IA pourrait tuer tous les humains. »
Auto-amélioration : objectif poursuivi, pas encore réalisé
Depuis plusieurs années, des acteurs de l'industrie expriment des inquiétudes concernant les systèmes d'IA capables de s'auto-améliorer, qui pourraient échapper au contrôle humain par le biais d'une amélioration récursive. Jusqu'à présent, un tel système d'IA n'a pas été conçu. Toutefois, certaines entreprises travaillent activement à cet objectif, et une proportion significative du code d'IA actuellement existant est déjà générée à l'aide de l'IA.
Une démission médiatisée et un passif de départs pour raisons de sécurité
Quelques heures avant les déclarations d'Evan Hubinger, Jacob Coxon a annoncé sur X sa démission d'Anthropic. Ce chercheur, qui entraînait des systèmes d'IA chez Anthropic après avoir travaillé sur des systèmes similaires chez OpenAI, explique son départ par une approche jugée laxiste de la sécurité. Il accuse Anthropic et OpenAI de se précipiter vers une superintelligence auto-améliorante et de « jouer avec nos vies », tout en affirmant que certains concepteurs d'IA croient sincèrement qu'elle pourrait tuer tous les humains d'ici la fin de la décennie. Son départ est présenté comme l'un des cas les plus médiatisés de sortie d'Anthropic, une entreprise fondée par d'anciens membres d'OpenAI à la suite de préoccupations sur la sécurité. Ces dernières années, plusieurs chercheurs ont également invoqué des raisons de sécurité pour quitter OpenAI.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.