Brief IA : OpenAI : l'IA GPT-Red surpasse les humains en détection d'attaques

OpenAI : l'IA GPT-Red surpasse les humains en détection d'attaques

Brief IA
Tom Levy·2 min·8 vues

OpenAI a développé GPT-Red, un modèle interne capable de détecter 84 % des attaques lors de tests, surpassant les 13 % de réussite des équipes humaines. Ce modèle utilise l'apprentissage par renforcement en auto-jeu pour améliorer la sécurité des systèmes d'IA, contribuant également à l'entraînement de GPT-5.6 Sol, qui présente six fois moins d'échecs sur les injections de prompt directes par rapport à un modèle précédent.

En bref
1OpenAI a développé GPT-Red, un modèle interne capable de détecter 84 % des attaques lors de tests, surpassant les humains.
2Les équipes humaines de test n'ont atteint qu'un taux de réussite de 13 %, montrant l'efficacité supérieure de l'IA.
3Les résultats obtenus par GPT-Red contribuent à l'amélioration de modèles comme GPT-5.6 Sol.
💡Pourquoi c'est importantL'utilisation d'IA pour tester et renforcer d'autres IA pourrait révolutionner la sécurité et la fiabilité des systèmes d'IA à l'avenir.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

OpenAI : l'IA GPT-Red surpasse les humains en détection d'attaques

OpenAI utilise désormais l'IA pour attaquer sa propre IA, et cela fonctionne mieux que ce que les humains ont pu réaliser.

OpenAI a formé un modèle d'IA interne appelé GPT-Red pour détecter automatiquement les failles de sécurité dans les modèles GPT. GPT-Red simule des injections de prompt et d'autres attaques où des instructions malveillantes se cachent dans des e-mails, des sites web ou des fichiers. Entraîné via un apprentissage par renforcement en auto-jeu, GPT-Red attaque pendant que les modèles de défense bloquent, et les deux s'améliorent au fil du temps. Il réussit à identifier des attaques dans 84 % des scénarios de test, contre 13 % pour les équipes rouges humaines. Dans un test, il a manipulé une machine à café alimentée par IA dans les bureaux d'OpenAI, modifiant les prix et annulant les commandes d'autres clients.

Les résultats alimentent directement l'entraînement. GPT-5.6 Sol présente six fois moins d'échecs sur les injections de prompt directes que le meilleur modèle d'il y a quatre mois, selon OpenAI, sans nuire à la performance générale. Cependant, environ 3,8 % des injections de prompt "plus fortes" réussissent encore. Si l'on considère des centaines ou des milliers de tentatives, un nombre considérable parvient à passer, similaire à Claude Opus 4.5.

Les taux de réussite des injections de prompt ont diminué régulièrement de GPT-5.3 à GPT-5.6 Sol, mais n'ont pas atteint zéro.

GPT-Red reste interne ; un article avec plus de détails suivra.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires