Brief IA : Google teste Gemini en évaluation d’IA à double insu

Google teste Gemini en évaluation d’IA à double insu

Brief IA
Tom Levy·3 min·2 vues

Google pilote une évaluation à double insu sur Gemini Flash Lite, utilisant le calcul confidentiel pour protéger les données et les poids. Des partenaires externes tels que l’Institut de sécurité de l’IA de Singapour, OpenMined, AVERI et MLCommons participent à cette initiative, qui vise à garantir l’intégrité des évaluations de modèles d’IA dans des contextes sensibles.

En bref
1Google pilote une évaluation à double insu sur Gemini Flash Lite
2Le dispositif s’appuie sur le calcul confidentiel pour protéger données et poids
3Des partenaires externes comme l’Institut de sécurité de l’IA de Singapour, OpenMined, AVERI et MLCommons participent
💡Pourquoi c'est importantCette approche vise à garantir l’intégrité des évaluations de modèles d’IA dans des contextes sensibles, sans exposer d’informations confidentielles.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Un pilote d’évaluations à double insu s’appuie sur le calcul confidentiel de Google pour empêcher l’exposition préalable aux jeux de test. Le dispositif vise des cas sensibles et autorise des organismes tiers à évaluer un modèle sans révéler ni les données ni les poids.

Des tests tiers sans accès aux données ni aux poids

Les évaluations à double insu permettent à des organisations indépendantes de tester des modèles avancés sans exposer la souveraineté des données ni la sécurité. Cette méthode est jugée particulièrement adaptée aux évaluations sensibles, comme celles menées en cybersécurité ou par des organismes gouvernementaux. Une preuve cryptographique contribue à éviter la contamination des références et à protéger les informations sensibles.

Un problème de confiance lié à la contamination des références

Si un modèle a déjà eu accès aux questions d’évaluation, ses résultats peuvent être faussés à la hausse. Pour garantir que les scores reflètent réellement les capacités et la sécurité d’un modèle, il est indispensable que les incitations de test restent inconnues du modèle avant l’évaluation. Les décideurs, chercheurs et entreprises attendent des références qui traduisent fidèlement les performances réelles.

Double insu et calcul confidentiel pour lever l’ancien compromis

Les évaluations externes à fort enjeu impliquaient auparavant de choisir entre partager les incitations de test ou les poids du modèle, ce qui exposait des informations sensibles. Le double insu supprime ce compromis grâce à l’espace confidentiel du portefeuille de Cloud Computing confidentiel de Google. Une vérification cryptographique assure que les données d’évaluation et le modèle restent privés pour leurs propriétaires respectifs. Dans ce dispositif, l’évaluateur n’accède pas aux poids du modèle Gemini et Google ne voit pas les incitations de test, les évaluations étant confinées dans une boîte cryptographique et dans un environnement préservant la vie privée.

Un pilote en cours avec Gemini Flash Lite et des partenaires

Une première évaluation à double insu d’un modèle d’IA avancé est en cours, testant Gemini Flash Lite avec des références confidentielles. L’initiative réunit l’Institut de sécurité de l’IA de Singapour, OpenMined, AVERI et MLCommons. Google précise évaluer ses systèmes tout au long du développement et du déploiement, en s’appuyant aussi sur des partenaires externes comme des laboratoires de recherche, la société civile et des Instituts de sécurité et de sûreté de l’IA pour des tests approfondis. Des protocoles de zéro journalisation et des garanties contractuelles étaient déjà en place pour protéger les incitations de test ; l’ajout de garanties techniques et cryptographiques est présenté comme une avancée. Ce pilote vise à établir une nouvelle étape dans la supervision des modèles pour encourager des systèmes d’IA plus sûrs, fiables et dignes de confiance.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires