Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI met en place des mesures de sécurité renforcées pour Astra, un modèle présenté comme capable de détecter et d’exploiter des failles inconnues. L’accès sera initialement limité et ces garde‑fous pourraient entraver certains usages, selon l’entreprise.
Des garde‑fous activés et un accès restreint dès le lancement
Astra est le premier modèle d’OpenAI à dépasser le seuil qui impose des protections renforcées prévues dans le protocole de sécurité interne, un seuil qui n’avait jusqu’ici jamais été atteint. OpenAI a déjà rendu plus difficile l’obtention d’actions cyber malveillantes via ce modèle. L’entreprise prévoit de surveiller l’activité d’Astra et de rechercher tout signe de dépassement des contraintes de sûreté. Le déploiement doit débuter très prochainement, avec un accès initial réservé à un groupe restreint de personnes. Selon la vice-présidente Amelia Glaese, ces mesures pourraient parfois ralentir, interrompre ou bloquer des activités légitimes.
Capacités offensives alléguées pour la cybersécurité
OpenAI présente Astra comme plus performant que ses modèles actuels pour repérer des failles de cybersécurité. D’après la vice-présidente Amelia Glaese, avec les outils et accès appropriés, Astra peut détecter des vulnérabilités inconnues et concevoir des moyens de les exploiter sur de nombreux systèmes bien protégés, sans supervision humaine à chaque étape. Des responsables de l’entreprise estiment que cette puissance nécessite des mesures de contrôle inédites. OpenAI poursuit par ailleurs l’augmentation de la puissance de ses modèles d’intelligence artificielle.
Un contexte marqué par des alertes et des précédents
Anthropic avait déjà annoncé avoir développé Mythos, un modèle jugé trop puissant pour être diffusé publiquement. Le récent piratage de Hugging Face est cité parmi les incidents qui renforcent les préoccupations de sécurité autour de l’IA.




