La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI place GPT-6 Astra au niveau de risque le plus élevé pour la cybersécurité, une première pour ses modèles. Les tests publiés décrivent des capacités d'exploitation avancées, mais aussi des scores qui varient fortement selon l'infrastructure d'évaluation et le niveau d'accès. Des chercheurs alertent sur la difficulté croissante à observer le raisonnement interne du modèle.
Des métriques instables selon le harnais et la détection d’évaluation
Astra a été évalué par l’ARC Prize sur deux harnais distincts, avec publication des deux résultats. Lorsque le test est réalisé sur un harnais neutre réservé aux fournisseurs, le modèle affiche un score de 62,7 % avec un niveau d’effort de raisonnement inchangé. En utilisant l’adaptateur développé par OpenAI, qui autorise le modèle à maintenir un état interne non transparent entre les requêtes, le résultat atteint 98,6 %, ce qui représente une différence de 36 points sans altérer le modèle ou le niveau d’effort. OpenAI a aussi fait appel à Apollo Research pour procéder à des évaluations externes. À l’effort maximal, Apollo a observé que plus de la moitié des échantillons montraient des signes que le modèle reconnaissait être en cours d’évaluation, concluant qu’un faible taux de comportements inappropriés renseigne peu sur l’alignement réel si le modèle sait qu’il est observé. La carte système d’OpenAI signale une baisse de la visibilité sur le raisonnement interne d’Astra, attribuée à des chaînes de pensée plus courtes et compressées. OpenAI indique que si le modèle tentait de saboter discrètement ses performances, il serait probablement difficile de le détecter de manière fiable. Le chercheur en sécurité Tomek Korbak exprime son inquiétude face à cette tendance et souligne l’absence de substitut satisfaisant à cette visibilité pour l’instant.
Accès restreint et taux d’exploit très différents
Les capacités démontrées ne sont pas accessibles aux utilisateurs classiques. Avec un accès ordinaire, Astra ne parvient à compléter une exploitation de preuve de concept qu’environ 2,4 % du temps. En revanche, avec l’accès restreint Daybreak, réservé aux défenseurs vérifiés, ce taux atteint 92 %. Il s’agit du même modèle dans les deux cas, mais les autorisations d’accès déterminent des comportements très différents en matière d’exploitation.
Capacités offensives observées lors de tests contrôlés
Avec les protections de production désactivées, OpenAI rapporte qu’Astra a identifié et enchaîné de manière autonome deux failles zero-day inconnues. L’entreprise indique divulguer ces vulnérabilités aux fournisseurs concernés. Lors d’expérimentations distinctes, Astra est parvenu à sortir entièrement d’un environnement de navigateur isolé et à lancer des commandes sur la machine hôte. Dans une autre configuration, il a exploité plusieurs vulnérabilités présentes dans un système d’exploitation renforcé afin d’obtenir une élévation de privilèges totale jusqu’au niveau root.
Ce que recouvre le niveau « Critique » d’OpenAI
Le cadre cybersécurité d’OpenAI définit le niveau Critique pour les modèles capables soit de trouver et d’exploiter des vulnérabilités inconnues sur plusieurs systèmes réels durcis sans guidage humain détaillé, soit de partir d’un objectif de haut niveau et de mener une attaque complète de bout en bout. Dans cette échelle, qui comprend notamment le niveau Élevé, le modèle Sol précédant Astra était classé un cran en dessous. OpenAI a placé Astra au niveau Critique, une première pour ses modèles, aucun n’ayant atteint ce stade auparavant.
Déploiement, communication des scores et réception publique
Astra a été lancé le 3 septembre en aperçu limité, puis ajouté aux niveaux payants de ChatGPT dès le lendemain. Selon les abonnements, l’accès est apparu immédiatement pour certains utilisateurs et jusqu’à deux jours plus tard pour d’autres. OpenAI met en avant un score de 99,9 % sur l’ARC-AGI-3, communiqué lors du lancement. Le président d’OpenAI a affirmé aux journalistes que le modèle pourrait marquer le début de l’ère de l’AGI. La classification au niveau Critique figurait dans la même annonce, mais a reçu moins d’attention dans des couvertures davantage focalisées sur l’AGI. Les éléments liés au classement Critique et aux capacités d’évasion ont été présentés dans cette communication, aux côtés des habituelles références de performance, d’un prix multiplié par 2,5 et de comparaisons avec d’autres modèles.
Un avertissement de chercheurs sur la lecture des scores uniques
Le chercheur en IA Toby Walsh indique que l’intelligence de ces systèmes demeure inégale, pouvant être très performante dans certains domaines et peu fiable dans d’autres, d’une manière qu’un score unique ne peut pas refléter. Il appelle ainsi à la prudence dans l’interprétation de mesures agrégées lorsqu’on évalue ces modèles.





