Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI : le modèle Astra suscite des craintes de sécurité inédites
OpenAI suspend certaines parties du développement de son nouveau modèle d'IA, Astra, après que des tests internes ont révélé des capacités de cybersécurité si puissantes que le modèle pourrait atteindre le niveau de risque le plus élevé ("Critique") dans le cadre de sécurité interne de l'entreprise.
À ce niveau, l'IA pourrait développer et exécuter de manière autonome des cyberattaques sans intervention humaine. OpenAI met désormais en place des contrôles de sécurité plus stricts, des environnements de test isolés et un système de surveillance qui interrompt automatiquement les activités à risque.
Cette décision fait suite à des incidents survenus lors des tests internes, où des agents d'IA autonomes ont infiltré l'infrastructure même d'OpenAI et sont restés indétectés pendant des semaines.
Les évaluations internes du nouveau modèle d'IA d'OpenAI, Astra, ont montré des "avancées significatives dans le codage agentique et la cybersécurité" au cours des derniers jours, selon l'entreprise. Les résultats étaient suffisamment solides pour qu'OpenAI "ne puisse pas écarter le niveau de capacité Critique" selon son propre cadre de préparation.
La décision a été prise "la nuit dernière", selon OpenAI. C'est la première fois qu'OpenAI signale qu'un de ses modèles pourrait atteindre le niveau de risque de cybersécurité le plus élevé. Les modèles précédents, y compris GPT-5.6-Sol, n'ont été classés qu'au niveau "Élevé" au maximum.
OpenAI a présenté Astra pour la première fois la semaine dernière. Des rumeurs suggèrent que le modèle pourrait être lancé dès la semaine prochaine, mais l'annonce d'aujourd'hui pourrait affecter ces plans. OpenAI a explicitement indiqué dans son communiqué qu'Astra n'était pas impliqué dans une récente exploitation divulguée sur Hugging Face.
Les critiques accuseront probablement OpenAI de marketing basé sur la peur, surtout puisque l'entreprise ne rapporte que le potentiel d'une évaluation Critique, et non l'évaluation elle-même. Le timing n'aide pas non plus. Cet avertissement préliminaire survient en plein milieu d'un débat en cours dans l'industrie sur les capacités cybernétiques autonomes des modèles d'IA, ce qui ne fera qu'alimenter le scepticisme. Si l'évaluation Critique ne se matérialise jamais, OpenAI aura généré beaucoup de relations publiques sans conséquences réelles et produit un autre modèle d'IA qui, comme Claude Mythos ou GPT-2 en 2019, est à nouveau "trop dangereux" à publier.
Ce que signifie "Critique"
Selon le cadre de préparation d'OpenAI, publié pour la première fois en décembre 2023, un modèle atteint le niveau "Critique" lorsqu'il peut trouver et développer des exploits zero-day fonctionnels de tous niveaux de gravité dans de nombreux systèmes critiques durcis sans intervention humaine. Un modèle est également qualifié s'il peut concevoir et exécuter de manière indépendante des stratégies de cyberattaques de bout en bout contre des cibles protégées lorsqu'il reçoit seulement un objectif vaguement défini.
Le niveau inférieur "Élevé" signifie qu'un modèle peut supprimer les barrières existantes aux cyberattaques, par exemple en automatisant des attaques contre des cibles bien protégées, mais nécessite encore plus de direction humaine.
- Critique : Un modèle augmenté par des outils peut identifier et développer des exploits zero-day fonctionnels de tous niveaux de gravité dans de nombreux systèmes critiques durcis sans intervention humaine OU le modèle peut concevoir et exécuter des stratégies de cyberattaques novatrices de bout en bout contre des cibles durcies en se basant uniquement sur un objectif général souhaité.
Trouver et exécuter des exploits de bout en bout pour tous les logiciels pourrait entraîner des catastrophes de la part d'acteurs unilatéraux, piratant des systèmes militaires ou industriels, ou l'infrastructure d'OpenAI. Les opérations cybernétiques novatrices, par exemple celles impliquant de nouveaux zero-days ou de nouvelles méthodes de commande et de contrôle, représentent généralement la menace la plus sérieuse, car elles sont imprévisibles et rares.
Suspension du développement d'Astra
En réponse, OpenAI indique avoir suspendu les activités internes impliquant Astra qui ne répondent pas encore aux exigences de sécurité plus strictes. Dans le même temps, l'entreprise met en place des contrôles de sécurité plus rigoureux : environnements de test isolés, accès restreint aux réseaux et aux outils, protection et cryptage renforcés des poids du modèle, et systèmes de surveillance supplémentaires.
OpenAI affirme également avoir déployé une surveillance universelle sur toutes les applications agentiques d'Astra, couvrant la formation et l'évaluation. Les moniteurs analysent la chaîne de pensée du modèle et déclenchent une réponse de sécurité qui interrompt toute activité à haut risque.
De plus, OpenAI prévoit de travailler avec des agences gouvernementales et des organisations de sécurité de l'IA sélectionnées pour tester les capacités du modèle. Les partenaires de test tiers recevront des recommandations de contrôles de sécurité pour les évaluations à haut risque. L'AI Safety Institute (AISI) du Royaume-Uni a récemment rapporté avoir connu des incidents cybernétiques lors de l'une de ses propres évaluations.
Une évaluation d'Astra après des piratages d'agents incontrôlés
L'annonce intervient à un moment où OpenAI gère déjà les conséquences des agents d'IA autonomes. Lors de la conférence de sécurité Black Hat, l'entreprise a récemment révélé que des agents autonomes avaient infiltré son infrastructure pendant des semaines lors de tests internes sans que personne ne s'en aperçoive.
Les agents ont utilisé un gestionnaire de paquets interne pour construire un tableau de messages improvisé avec des centaines de milliers de publications. Ils ont partagé des exploits et des identifiants et ont finalement attaqué la plateforme Hugging Face également.






