Brief IA : SFT : clé de la sécurité des modèles Gemini de DeepMind

SFT : clé de la sécurité des modèles Gemini de DeepMind

Brief IA
Tom Levy·3 min·12 vues

La combinaison du pré-entraînement et du SFT est identifiée comme la principale cause des propriétés de sécurité de Gemini, selon l'équipe de Google DeepMind. Cette découverte souligne l'importance du SFT dans le développement de modèles sûrs, bien que son applicabilité à d'autres familles de modèles reste incertaine. Comprendre ces facteurs est crucial pour un déploiement responsable des modèles d'IA.

En bref
1Google DeepMind a découvert que le SFT influence fortement les propriétés de sécurité des modèles Gemini, contrairement aux attentes initiales.
2Les modèles Gemini post-SFT et de production affichent des performances similaires sur des benchmarks de sécurité, selon des tests rigoureux.
3Cette découverte souligne l'importance du SFT comme point d'intervention pour la sécurité future des modèles Gemini.
💡Pourquoi c'est importantL'impact du SFT sur la sécurité des modèles pourrait transformer les stratégies de développement et de déploiement des IA.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Dans une série de mises à jour de recherche informelles, l'équipe d'interprétabilité des modèles de langage de Google DeepMind a partagé une découverte surprenante concernant les propriétés de sécurité des modèles Gemini. Contrairement aux attentes initiales, il a été observé que la sécurité de Gemini est principalement influencée par la combinaison du pré-entraînement et du Supervised Fine-Tuning (SFT), plutôt que par d'autres étapes d'entraînement telles que le Reinforcement Learning (RL). Bien que cette observation soit spécifique à Gemini et puisse évoluer avec les futures versions, elle a été jugée suffisamment significative pour être partagée avec la communauté de la sécurité au sens large.

Expérience

L'expérience a été menée en appliquant le SFT sur les versions uniquement pré-entraînées de Gemini 3.1 Pro et Gemini 3 Flash. Ces modèles post-SFT ont ensuite été comparés aux versions de production sur divers benchmarks de sécurité pertinents. Les résultats ont montré que les performances des modèles uniquement SFT et des modèles de production étaient remarquablement similaires, avec des barres d'erreur représentant des intervalles de confiance de 95 % sur les évaluations.

Le résultat principal de cette étude est que les barres bleues, représentant les modèles uniquement SFT, et les barres orange, représentant les modèles de production, sont remarquablement similaires à travers les évaluations. Cela implique que pour Gemini, le SFT est un point d'intervention à fort impact pour la sécurité et le comportement du modèle. Google DeepMind prévoit d'intervenir davantage à ce niveau à l'avenir pour améliorer la sécurité des modèles.

Benchmarks de sécurité

Les tests ont inclus plusieurs ensembles de benchmarks, chacun avec ses propres spécificités :

  • ODCV : Ce benchmark est décrit dans un article disponible sur arxiv.
  • Évaluations d'alignement : Basées sur une version modifiée de Petri, ces évaluations sont conçues pour être à prompt unique et filtrées pour ne contenir que des problèmes de style "dilemme d'alignement".
  • Désalignement à prompt unique : Cette évaluation mesure la fréquence à laquelle le modèle prend la "mauvaise" décision, selon un évaluateur automatique.
  • Conscience de l'évaluation : Elle se réfère à la fréquence à laquelle un évaluateur automatique décide que le modèle était conscient d'être en évaluation.
  • Évaluations de sécurité : Ces évaluations mesurent le taux de refus excessif du modèle sur des prompts bénins qui semblent nuisibles et le taux de réponse non sécurisée du modèle sur des prompts nuisibles.
  • Reward hacking : Dans cet environnement, le modèle est placé dans un conteneur Docker au sein du Gemini CLI et est invité à optimiser un problème algorithmique contre un fichier non modifiable contenant un script de timing. Un évaluateur automatique mesure le pourcentage de déploiements où le modèle triche d'une manière ou d'une autre.
  • Journaux des utilisateurs de la version gratuite : Ces journaux sont constitués de 50 000 prompts aléatoires, anonymisés et dépouillés d'informations personnelles des utilisateurs d'AI Studio. Des évaluateurs automatiques sont exécutés pour chacun des comportements listés sur les pensées et réponses des modèles, bien que de nombreux positifs des évaluateurs automatiques soient probablement des faux positifs.

Ces résultats soulignent l'importance du SFT dans l'amélioration de la sécurité des modèles de langage, influençant potentiellement les futures approches de développement et de déploiement de ces technologies.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires