Brief IA : OpenAI et Anthropic : alertes internes sur le risque d’extinction

OpenAI et Anthropic : alertes internes sur le risque d’extinction

Brief IA
Tom Levy·4 min·3 vues

Marcus Williams (OpenAI) estime à 70% le risque d’extinction en 3 ans sans régulation Plusieurs chercheurs jugent qu’aucun plan viable n’existe pour l’alignement d’une superintelligence auto-améliorante Des appels à réguler ou ralentir la course se multiplient, tandis que certains défendent les bénéfices attendus.

En bref
1Marcus Williams (OpenAI) estime à 70% le risque d’extinction en 3 ans sans régulation
2Plusieurs chercheurs jugent qu’aucun plan viable n’existe pour l’alignement d’une superintelligence auto-améliorante
3Des appels à réguler ou ralentir la course se multiplient, tandis que certains défendent les bénéfices attendus
💡Pourquoi c'est importantCes prises de parole publiques témoignent d’une inquiétude croissante au sein des laboratoires d’IA sur les risques existentiels et l’absence de solutions éprouvées.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Des chercheurs et ingénieurs d’OpenAI et d’Anthropic alertent sur des probabilités élevées de perte de contrôle, voire d’extinction, à court terme si l’IA progresse sans garde-fous. Plusieurs affirment qu’aucun plan scientifique viable n’existe aujourd’hui pour l’alignement d’une superintelligence issue d’auto-amélioration. D’autres appellent à réguler ou ralentir la course, tandis que quelques voix insistent sur les bénéfices potentiels de la technologie.

Des probabilités chiffrées jusque 70% à très court terme

Marcus Williams, membre de l’équipe de surveillance de la sécurité chez OpenAI, estime à 70% le risque d’extinction humaine dans les trois prochaines années si aucune régulation ou ralentissement coordonné n’est mis en place. Il considère l’extinction très probable à court terme en l’absence de mesures. Paul Christiano, chercheur en sécurité de l’IA chez OpenAI, évoque un risque significatif que l’accélération rapide des capacités de l’IA entraîne une perte de contrôle catastrophique et irréversible à très court terme, et estime que la plupart des gens pourraient mourir si une superintelligence était construite sans alignement plus robuste. Il juge que l’industrie, y compris OpenAI, n’est pas sur la bonne voie pour réduire ce risque à un niveau acceptable. Chez Anthropic, Evan Hubinger situe personnellement la probabilité que l’IA tue tous les humains à plus de 10% dans la prochaine décennie. Geoffrey Hinton, interrogé par la BBC, considère qu’une estimation de 10% de probabilité d’anéantissement de l’humanité sur dix ans n’est pas déraisonnable.

Des capacités de sécurité jugées insuffisantes face à l’auto-amélioration

Plusieurs salariés estiment que les mesures de sécurité actuelles ne suffisent pas pour faire face à une superintelligence auto-améliorante. Evan Hubinger considère qu’Anthropic n’a pas de plan pour résoudre l’alignement de tels systèmes et n’est pas clairement sur la bonne voie. Anna Wang affirme qu’il n’existe pas encore de plan scientifique viable pour traiter les risques d’une IA s’auto-améliorant récursivement, une préoccupation qu’Evan Hubinger partage. Samuel Marks ajoute que les modèles d’IA se comportent souvent de manière sévèrement inappropriée : il existe des méthodes pour les inciter à de meilleurs comportements, mais pas pour les aligner de manière robuste. Jen Leike rappelle que des atténuations concrètes, comme celles de jailbreak pour Opus 4, ont nécessité plus d’un an de travail.

Réguler ou ralentir : appels répétés et course déclarée

Face au rythme actuel, des appels à une action collective se multiplient. Jen Leike estime qu’il est temps de mettre en place des mécanismes institutionnels pour réguler le développement de l’IA et souligne que l’industrie est engagée dans une course totale vers la superintelligence, d’où la nécessité éventuelle d’accorder davantage de temps aux atténuations de sécurité et d’alignement. Marcus Williams juge qu’une régulation ou un ralentissement coordonné est très possible. Tomek Korbak considère qu’Anthropic comme OpenAI ne sont pas en mesure de résoudre l’alignement à un niveau suffisant pour expédier une superintelligence et appelle à ralentir. Julie Steele, de l’équipe de préparation d’OpenAI, estime aussi qu’il faut ralentir.

Une démission emblématique et un recrutement stratégique

La démission de Jacob Coxon, après trois ans de recherche chez Anthropic, a ravivé les critiques contre la course aux systèmes auto-améliorants. Il accuse Anthropic et OpenAI de ne pas agir de manière responsable et de se précipiter vers une superintelligence en pariant avec des vies humaines. Il affirme que des dirigeants redoutent en privé une issue catastrophique et que des personnes développant l’IA croient qu’elle pourrait tuer toute l’humanité d’ici la fin de la décennie, tout en décrivant une dynamique de compétition interne au secteur. Parallèlement, OpenAI a annoncé l’arrivée de Paul Christiano à son conseil d’administration et à son comité de sécurité. Le débat intervient alors que des dirigeants, dont Dario Amodei, ont publiquement communiqué leurs propres estimations de p(doom).

Des positions contrastées au sein des équipes

Anna Wang explique rester chez Anthropic pour réduire les risques de l’intérieur, tout en soutenant ceux qui préfèrent agir de l’extérieur. Samuel Marks dit travailler sur la sécurité pour diminuer la probabilité de scénarios catastrophiques et observe que l’inquiétude augmente avec le niveau de séniorité. À l’inverse, Chris Hayduk met en avant sa conviction que l’IA sera extrêmement bénéfique pour l’humanité et évoque des milliards de vies sauvées. Jacob Coxon, qui a travaillé sur GPT-4o lorsqu’il était chez OpenAI, illustre la circulation des talents entre laboratoires. Globalement, des salariés d’Anthropic et d’OpenAI s’expriment publiquement sur les risques de catastrophe et l’état des garde-fous.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires