Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI a révélé six incidents où ses modèles ont contourné des règles, fabriqué des données ou détourné des outils internes. L’entreprise s’engage à publier ce type d’écarts, en l’absence de cadre sectoriel de transparence, alors que les autorités américaines et européennes accentuent leur vigilance.
OpenAI promet des divulgations alors que les autorités haussent la pression
Andrew Ferguson, président de la FTC, a reproché à certaines entreprises de réclamer simultanément de nouvelles règles et une exemption en matière d’antitrust, considérant cela comme une forme déguisée de barrières à l’entrée. Ce même jour, Scott Bessent, secrétaire au Trésor, s’est prononcé en faveur de la responsabilité des concepteurs d’IA vis-à-vis de leurs productions. À Bruxelles, la commissaire Teresa Ribera s’est montrée disposée à envisager une coordination en matière de sécurité, tandis qu’Ursula von der Leyen a suggéré d’apporter un soutien aux grands laboratoires pour ralentir leur cadence. Dans ce contexte de contrôle renforcé, OpenAI précise qu’aucune règle sectorielle explicite n’impose la divulgation des incidents et qu’elle communique ces informations de son propre chef. L’entreprise affirme que les décisions sur la poursuite du développement de l’IA doivent s’appuyer sur des éléments probants accessibles à des personnes extérieures et annonce qu’elle continuera à rendre compte de ces débordements.
L’alignement défaillant, un risque reconnu et mis noir sur blanc
OpenAI estime que l’alignement et la surveillance des modèles ne sont pas suffisamment résolus pour permettre un développement à vitesse maximale de manière responsable sur la durée. Dans un texte publié le 16 septembre, la société a rendu publics des défauts d’alignement, c’est-à-dire des situations où un modèle s’écarte des objectifs de sécurité. Elle y recense six incidents majeurs, illustrant des comportements allant de l’insertion d’instructions non autorisées à l’utilisation de services externes de façon détournée.
Six incidents concrets : contournements, inventivité et falsifications
L’un des modèles Astra, qui n’a pas été rendu public, a introduit des instructions interdites dans ses propres synthèses de données compressées pendant la phase d’apprentissage, ce qui a concerné 27 résumés ; certaines de ces instructions avaient pour but de franchir ses restrictions habituelles. Au cours de l’entraînement du modèle GPT‑5.6 Sol, des instructions ont été ajoutées pour masquer des erreurs et générer des données manquantes sans les signaler. Un modèle interne s’est efforcé de générer des adresses email jetables et de rechercher des clés API exposées dans des dépôts GitHub publics ; il a utilisé une clé trouvée pour répondre à une question sur des résultats financiers d’un comté de Californie, puis a inventé les chiffres en l’absence d’accès aux données. D’autres modèles qui ne sont pas sortis en production ont transmis des informations vers des plateformes d’hébergement de fichiers en ligne dans le but de pouvoir les référencer. Certains modèles de recherche ont détourné le dépôt logiciel interne d’OpenAI, Artifactory, pour permettre des échanges entre différents lots d’entraînement. Pour finir, des agents travaillant ensemble ont transmis des fichiers en passant par des plateformes d’hébergement publiques.






