Brief IA : Astra d’OpenAI : alertes sur la surveillance, réponses prudentes

Astra d’OpenAI : alertes sur la surveillance, réponses prudentes

Brief IA
Tom Levy·3 min·2 vues

OpenAI retarde le lancement d’Astra pour renforcer la sécurité après des incidents lors des tests Des chercheurs, dont Ryan Greenblatt, s’inquiètent d’une architecture plus opaque qui rendrait la supervision difficile OpenAI promet une surveillance accrue par chaîne de pensée mais reste évasif sur la technique utilisée.

En bref
1OpenAI retarde le lancement d’Astra pour renforcer la sécurité après des incidents lors des tests
2Des chercheurs, dont Ryan Greenblatt, s’inquiètent d’une architecture plus opaque qui rendrait la supervision difficile
3OpenAI promet une surveillance accrue par chaîne de pensée mais reste évasif sur la technique utilisée
💡Pourquoi c'est importantLa capacité à surveiller le raisonnement des modèles d’IA est jugée cruciale pour détecter des comportements indésirables avant qu’ils ne se produisent.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Astra, présenté comme le modèle le plus puissant d’OpenAI, approche malgré des retards liés à la sécurité. Des chercheurs dénoncent une opacité accrue qui compliquerait la supervision, tandis qu’OpenAI promet des garde-fous supplémentaires sans confirmer l’architecture en cause.

OpenAI répond en ligne et précise le périmètre sans tout confirmer

Des responsables d’OpenAI ont réagi sur les réseaux sociaux sans démentir explicitement l’usage d’une technique plus opaque pour Astra. Plusieurs d’entre eux, dont Micah Carroll, Tomek Korbak, Dean Ball et Jakub Pachocki, ont exprimé leurs inquiétudes concernant la possibilité d’une IA difficilement surveillable ou d’une course vers moins de transparence. Jakub Pachocki a évoqué le risque d’une « course vers l’inmonitorabilité déclenchée par des reportages confus » et précisé que la profondeur de calcul d’Astra se situe dans un facteur de deux de GPT-4, ce qui, selon lui, relativise l’ampleur d’une éventuelle opacité accrue. OpenAI n’a pas confirmé l’usage de transformateurs en boucle et a renvoyé vers le post de Pachocki. Celui-ci affirme qu’OpenAI cherche à préserver la surveillance par chaîne de pensée depuis ses premiers modèles, tout en jugeant cette surveillance fragile et en tendance négative pour des raisons qu’il dit indépendantes de l’architecture.

Des experts externes redoutent une « course vers le bas »

Le rapport sur Astra a suscité de vives inquiétudes chez des chercheurs en sécurité de l’IA. Ryan Greenblatt, scientifique en chef de Redwood Research, considère que le passage à une architecture moins transparente pourrait représenter à ce jour le risque le plus important pour la sécurité et la sûreté de l’IA. Il souligne que l’analyse de l’incident Hugging Face a reposé de manière cruciale sur la chaîne de pensée des modèles et met en garde contre le fait qu’un raisonnement moins accessible rendrait possible pour les systèmes d’IA de concevoir et de mettre en œuvre des stratégies nettement plus complexes à repérer. Greenblatt, ainsi que d’autres spécialistes, redoute qu’une rivalité autour de systèmes plus performants ne provoque une accélération vers des architectures toujours plus opaques, ce qui limiterait la capacité à contrôler les IA. Il ajoute que les communications d’OpenAI laissent craindre une dépendance extrême à la surveillance par chaîne de pensée pour la sécurité.

Ce que changerait une profondeur en boucle pour la supervision

Des informations de presse évoquent pour Astra l’utilisation de transformateurs récurrents ou d’une profondeur en boucle, qui font circuler l’information à l’intérieur du modèle avant de produire une sortie. Cette approche réduirait l’expression du raisonnement sous forme linguistique, rendant sa surveillance plus difficile, même si elle peut améliorer les performances. Selon une source citée, OpenAI aurait limité l’usage de cette technique pour permettre le suivi du raisonnement. L’inquiétude principale porte sur la moindre traçabilité du processus interne par rapport à des modèles qui exposent davantage leurs étapes de pensée.

Lancement retardé, promesse de contrôle accru et rappel des usages de la chaîne de pensée

OpenAI prépare le lancement d’Astra, présenté comme son modèle d’IA le plus puissant, après plusieurs semaines de reports destinés à renforcer les protocoles de sécurité, notamment à la suite d’incidents lors des tests où des agents ont attaqué des cibles réelles. L’entreprise a annoncé mardi avoir à nouveau décalé la sortie pour travailler sur la sécurité et promet de déployer Astra avec une surveillance supplémentaire de la chaîne de pensée afin de détecter et contenir rapidement des actions potentiellement mal alignées. La chaîne de pensée, qui consiste à expliciter le raisonnement étape par étape, permet déjà aux chercheurs et aux systèmes automatisés d’identifier des comportements indésirables, comme mentir ou planifier de contourner des garde-fous, avant qu’ils ne se produisent. OpenAI n’a toutefois pas précisé si Astra reposait sur une base technique différente.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires