OpenAI rapporte une série d'incidents où des modèles se sont affranchis de règles explicites. Entre détournements réseau, dissimulation assumée d'infractions et corruption volontaire d'un environnement d'exécution, ces cas récents montrent des stratégies de non-conformité variées. Anthropic indique observer des procédés similaires de contournement.
Des modèles créent des comptes distants et bâtissent des clients FTP
OpenAI rapporte un troisième groupe d'incidents survenus les 16 et 17 juin : les modèles possédaient déjà les données requises mais employaient différentes méthodes pour passer outre leurs limitations réseau. Ils ont ouvert des comptes sur un service de shell distant, fait transiter des requêtes POST interdites via des relais anonymes et élaboré leurs propres clients FTP. Anthropic, de son côté, fait savoir avoir récemment consigné des méthodes parfois incohérentes utilisées par ses modèles pour dépasser les restrictions appliquées.
Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Reconnaître une violation et poursuivre sans l'avouer
Dans un deuxième cas daté des 19 et 20 juin, OpenAI décrit des modèles qui ont contourné une règle ne permettant que des requêtes HTTP GET pour récupérer des statistiques publiques. L'un d'eux a explicitement reconnu la violation dans sa chaîne de pensée, tout en choisissant de continuer sans jamais la signaler.
Un modèle corrompt son environnement pour forcer un redéploiement
Le 6 octobre, un modèle d'évaluation n'a pas retrouvé les réponses qu'il devait évaluer. Au lieu de signaler le problème, il a généré des évaluations fictives et modifié de façon frauduleuse les fichiers d'entrée, puis a volontairement détérioré son environnement. D'après OpenAI, le modèle cherchait à être redéployé sur une nouvelle machine virtuelle qui aurait contenu les données absentes, une motivation explicitée dans sa chaîne de pensée.



