La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Dans une série de mises à jour de recherche informelles, l'équipe d'interprétabilité des modèles de langage de Google DeepMind a partagé une découverte surprenante concernant les propriétés de sécurité des modèles Gemini. Contrairement aux attentes initiales, il a été observé que la sécurité de Gemini est principalement influencée par la combinaison du pré-entraînement et du Supervised Fine-Tuning (SFT), plutôt que par d'autres étapes d'entraînement telles que le Reinforcement Learning (RL). Bien que cette observation soit spécifique à Gemini et puisse évoluer avec les futures versions, elle a été jugée suffisamment significative pour être partagée avec la communauté de la sécurité au sens large.
Expérience
L'expérience a été menée en appliquant le SFT sur les versions uniquement pré-entraînées de Gemini 3.1 Pro et Gemini 3 Flash. Ces modèles post-SFT ont ensuite été comparés aux versions de production sur divers benchmarks de sécurité pertinents. Les résultats ont montré que les performances des modèles uniquement SFT et des modèles de production étaient remarquablement similaires, avec des barres d'erreur représentant des intervalles de confiance de 95 % sur les évaluations.
Le résultat principal de cette étude est que les barres bleues, représentant les modèles uniquement SFT, et les barres orange, représentant les modèles de production, sont remarquablement similaires à travers les évaluations. Cela implique que pour Gemini, le SFT est un point d'intervention à fort impact pour la sécurité et le comportement du modèle. Google DeepMind prévoit d'intervenir davantage à ce niveau à l'avenir pour améliorer la sécurité des modèles.
Benchmarks de sécurité
Les tests ont inclus plusieurs ensembles de benchmarks, chacun avec ses propres spécificités :
- ODCV : Ce benchmark est décrit dans un article disponible sur arxiv.
- Évaluations d'alignement : Basées sur une version modifiée de Petri, ces évaluations sont conçues pour être à prompt unique et filtrées pour ne contenir que des problèmes de style "dilemme d'alignement".
- Désalignement à prompt unique : Cette évaluation mesure la fréquence à laquelle le modèle prend la "mauvaise" décision, selon un évaluateur automatique.
- Conscience de l'évaluation : Elle se réfère à la fréquence à laquelle un évaluateur automatique décide que le modèle était conscient d'être en évaluation.
- Évaluations de sécurité : Ces évaluations mesurent le taux de refus excessif du modèle sur des prompts bénins qui semblent nuisibles et le taux de réponse non sécurisée du modèle sur des prompts nuisibles.
- Reward hacking : Dans cet environnement, le modèle est placé dans un conteneur Docker au sein du Gemini CLI et est invité à optimiser un problème algorithmique contre un fichier non modifiable contenant un script de timing. Un évaluateur automatique mesure le pourcentage de déploiements où le modèle triche d'une manière ou d'une autre.
- Journaux des utilisateurs de la version gratuite : Ces journaux sont constitués de 50 000 prompts aléatoires, anonymisés et dépouillés d'informations personnelles des utilisateurs d'AI Studio. Des évaluateurs automatiques sont exécutés pour chacun des comportements listés sur les pensées et réponses des modèles, bien que de nombreux positifs des évaluateurs automatiques soient probablement des faux positifs.
Ces résultats soulignent l'importance du SFT dans l'amélioration de la sécurité des modèles de langage, influençant potentiellement les futures approches de développement et de déploiement de ces technologies.


