La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un pilote d’évaluations à double insu s’appuie sur le calcul confidentiel de Google pour empêcher l’exposition préalable aux jeux de test. Le dispositif vise des cas sensibles et autorise des organismes tiers à évaluer un modèle sans révéler ni les données ni les poids.
Des tests tiers sans accès aux données ni aux poids
Les évaluations à double insu permettent à des organisations indépendantes de tester des modèles avancés sans exposer la souveraineté des données ni la sécurité. Cette méthode est jugée particulièrement adaptée aux évaluations sensibles, comme celles menées en cybersécurité ou par des organismes gouvernementaux. Une preuve cryptographique contribue à éviter la contamination des références et à protéger les informations sensibles.
Un problème de confiance lié à la contamination des références
Si un modèle a déjà eu accès aux questions d’évaluation, ses résultats peuvent être faussés à la hausse. Pour garantir que les scores reflètent réellement les capacités et la sécurité d’un modèle, il est indispensable que les incitations de test restent inconnues du modèle avant l’évaluation. Les décideurs, chercheurs et entreprises attendent des références qui traduisent fidèlement les performances réelles.
Double insu et calcul confidentiel pour lever l’ancien compromis
Les évaluations externes à fort enjeu impliquaient auparavant de choisir entre partager les incitations de test ou les poids du modèle, ce qui exposait des informations sensibles. Le double insu supprime ce compromis grâce à l’espace confidentiel du portefeuille de Cloud Computing confidentiel de Google. Une vérification cryptographique assure que les données d’évaluation et le modèle restent privés pour leurs propriétaires respectifs. Dans ce dispositif, l’évaluateur n’accède pas aux poids du modèle Gemini et Google ne voit pas les incitations de test, les évaluations étant confinées dans une boîte cryptographique et dans un environnement préservant la vie privée.
Un pilote en cours avec Gemini Flash Lite et des partenaires
Une première évaluation à double insu d’un modèle d’IA avancé est en cours, testant Gemini Flash Lite avec des références confidentielles. L’initiative réunit l’Institut de sécurité de l’IA de Singapour, OpenMined, AVERI et MLCommons. Google précise évaluer ses systèmes tout au long du développement et du déploiement, en s’appuyant aussi sur des partenaires externes comme des laboratoires de recherche, la société civile et des Instituts de sécurité et de sûreté de l’IA pour des tests approfondis. Des protocoles de zéro journalisation et des garanties contractuelles étaient déjà en place pour protéger les incitations de test ; l’ajout de garanties techniques et cryptographiques est présenté comme une avancée. Ce pilote vise à établir une nouvelle étape dans la supervision des modèles pour encourager des systèmes d’IA plus sûrs, fiables et dignes de confiance.





