GPT-6 Astra : 8,5 % d'injections cachées réussies malgré des progrès

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI annonce une forte réduction des erreurs et des blocages quasi systématiques des manipulations directes avec GPT-6 Astra. Des évaluations internes et externes montrent toutefois des vulnérabilités aux attaques adaptatives et aux injections de prompt dissimulées dans des documents, avec un taux de compromission de 8,5 % selon Gray Swan.
Attaques adaptatives : 67 % de défense, tests sans couches de production
Lorsque les attaquants adaptent leur stratégie au fil des échanges, GPT-6 Astra maintient un taux de défense d'environ 67 %, selon OpenAI. Les modèles précédents obtenaient juste en dessous de 50 % sur ce même test. OpenAI précise que ces évaluations ont été réalisées sur le modèle brut, sans les protections de production comme les classificateurs. Pour les injections de prompt indirectes, Gray Swan rapporte qu'avec 15 tentatives par scénario, Astra a été compromise au moins une fois dans 8,5 % des cas. Dans la même évaluation, Claude Opus 5 atteint 4,8 %, sans être totalement à l'abri.
Moins d'hallucinations et 99,99 % de blocage des injections directes
OpenAI indique que GPT-6 Astra hallucine moins que GPT-5.6 Sol et commet beaucoup moins d'erreurs factuelles. Les essais ont été réalisés à partir de discussions ChatGPT remontées par les utilisateurs pour des réponses inexactes ; Astra a commis ces mêmes erreurs de façon bien plus occasionnelle, avec des améliorations marquées à faible latence et sur des tâches de raisonnement simples. Pour ce qui concerne les injections de prompt directes, OpenAI fait état d'un taux de défense de 99,99 %. Lorsqu'il est confronté à un lot défini d'attaques cherchant à produire des contenus dangereux en biologie, violence ou cybersécurité, Astra refuse d'apporter son aide dans une proportion allant de 91,5 à 98,3 %. OpenAI indique aussi que la résistance aux jailbreaks s'améliore par rapport aux versions antérieures.
Évaluations de Gray Swan : 1 810 attaques issues de l’IPI Arena
La société de sécurité Gray Swan a mené des tests externes avec 1 810 attaques soigneusement sélectionnées depuis son IPI Arena. Dans ce cadre, GPT-5.6 Sol échoue 27 % du temps, ce qui permet de mesurer l'amélioration apportée par Astra. Gray Swan a aussi évalué des agents IA capables d'écrire du code, d'utiliser des outils et de contrôler des ordinateurs de façon autonome.
Un nouveau modèle et une méthode d'entraînement axée sur l'attaque
OpenAI présente GPT-6 Astra comme son nouveau modèle phare. Selon l'entreprise, une partie de ses capacités défensives provient de GPT-Red, une approche d'entraînement intégrant un attaquant automatisé. Bien que ces mesures existent, OpenAI précise que des attaquants déterminés peuvent toujours obtenir au moins une réponse problématique dans environ un tiers des cas après plusieurs tentatives. Le fait que des agents IA soient développés pour opérer de façon continue à grande échelle, avec notamment la lecture et l'analyse de documents parmi leurs fonctions principales, accentue la nécessité de telles protections.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.