Brief IA : OpenAI : inquiétudes sur la « récurrence opaque » d’Astra

OpenAI : inquiétudes sur la « récurrence opaque » d’Astra

Brief IA
Tom Levy·3 min·5 vues

Des experts en sécurité de l'IA, dont Ryan Greenblatt, alertent sur les risques de la « récurrence opaque » dans Astra, craignant qu'elle rende le raisonnement des modèles moins contrôlable et moins surveillable. OpenAI assure que l'usage de cette technique reste limité et que la chaîne de pensée d'Astra devrait demeurer lisible, tout en prévoyant un renforcement de la surveillance.

En bref
1Des experts en sécurité de l’IA s’inquiètent de l’impact de la « récurrence opaque » sur la surveillabilité de la chaîne de pensée dans Astra
2OpenAI affirme que l’usage de cette technique reste limité et que la chaîne de pensée d’Astra devrait rester lisible
3Des chercheurs comme Buck Shlegeris, Zvi Mowshowitz et Ryan Greenblatt alertent sur les risques d’une généralisation de cette approche
💡Pourquoi c'est importantLa capacité à surveiller le raisonnement des modèles d’IA est considérée comme essentielle pour détecter et comprendre les comportements indésirables ou désalignés.
Le brief IA que lisent les pros

L’IA et sa régulation t’intéressent ?

Lois, cadres et décisions qui façonnent l’IA, décryptés en français. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Des figures de la sécurité de l’IA redoutent que la « profondeur récurrente » rende la chaîne de pensée moins contrôlable. OpenAI assure que l’usage prévu dans Astra reste limité, que les traces resteront lisibles et qu’un renforcement de la surveillance est au programme.

Des alertes sur un basculement vers un raisonnement invisible

Ryan Greenblatt, scientifique en chef de Redwood Research, estime que le raisonnement opaque pourrait progresser plus vite que la chaîne de pensée conventionnelle, au point de supprimer le raisonnement des canaux observables. Il craint qu'une évolution naturelle n'amène à augmenter la part de raisonnement opaque jusqu'à ce que le modèle raisonne presque entièrement dans l'espace latent. Il espère qu'il n'est pas trop tard pour éviter les architectures les plus préoccupantes et qu'OpenAI s'arrêtera à ce stade. Plus largement, l'inquiétude demeure que la récurrence opaque rende la surveillance du raisonnement plus difficile, surtout si cette approche se diffuse à d'autres modèles.

OpenAI promet une chaîne de pensée lisible et des outils de suivi

OpenAI affirme que, même avec la récurrence opaque, la chaîne de pensée d’Astra devrait rester lisible et que l’usage de cette technique semble limité. L’entreprise rejette l’idée d’un passage à un « neuralese ». Elle annonce des systèmes étendus de surveillance de la chaîne de pensée dans ses plans de sécurité à venir. Jakub Pachocki, scientifique en chef d’OpenAI, rappelle que préserver et utiliser la surveillance de la chaîne de pensée est une priorité depuis les premiers modèles de raisonnement et que cela constitue un objectif central du programme de recherche actuel.

La chaîne de pensée, un repère fragile mis à l’épreuve par la récurrence

La chaîne de pensée d’un modèle de raisonnement correspond généralement aux étapes séquentielles suivies pour résoudre un problème. Malgré ses limites, elle reste un outil utile pour surveiller les comportements indésirables ou les désalignements, et a permis de comprendre les décisions d’agents hors de contrôle lors d’incidents récents. Avec la récurrence opaque, cet équilibre se trouve modifié : le modèle effectue plusieurs passages sur une même requête, selon une logique moins linéaire, ce qui produit moins d’indices exploitables et échappe au journal habituel des étapes. Dans tous les modèles d’IA, une certaine opacité du raisonnement subsiste, et rares sont les chercheurs qui voient dans les journaux de chaîne de pensée une transcription fidèle du raisonnement du modèle. Plusieurs experts jugent toutefois que la « profondeur récurrente » risque de compliquer la surveillabilité.

Astra visé, la communauté sécurité multiplie les mises en garde

Buck Shlegeris, PDG de Redwood, s’est dit extrêmement préoccupé par l’utilisation de la récurrence opaque dans Astra. Il indique ne pas savoir si Astra est beaucoup moins surveillable que les modèles précédents, mais avertit que pousser cette technique plus loin permettrait d’augmenter massivement la récurrence et de détruire la surveillabilité de la chaîne de pensée. Zvi Mowshowitz, défenseur de la sécurité de l’IA, estime que des lois pourraient être nécessaires pour éviter une « course vers le bas » entre laboratoires. Il considère que cette technique risque de briser un tabou établi par OpenAI et Anthropic autour de la fidélité et de la surveillabilité de la chaîne de pensée, et juge qu’un usage plus intensif endommagerait probablement cette surveillabilité. Ces réactions se sont multipliées alors qu’Astra doit utiliser une « profondeur récurrente » qui s’écarte d’un raisonnement strictement séquentiel.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires