Google DeepMind : Sécurité et Alignement de l'IA, un Bilan Stratégique

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Introduction à l'équipe de Sécurité et Alignement de l'AGI
Au sein de Google DeepMind, l'équipe de Sécurité et Alignement de l'AGI (ASAT) se consacre à l'élaboration de stratégies techniques pour minimiser les risques existentiels associés aux systèmes d'intelligence artificielle avancée. L'année précédente, l'équipe a publié un document fondamental intitulé "An Approach to Technical AGI Safety and Security", qui reste une référence essentielle pour comprendre leur approche globale en matière de sécurité de l'IA.
Évolution des Normes autour de la Chaîne de Pensée
L'une des contributions majeures de l'équipe ASAT a été de transformer la perception de la chaîne de pensée dans l'industrie. Initialement perçue comme peu fiable et donc peu utile, cette approche est désormais reconnue comme un outil précieux qui mérite d'être préservé. Ce changement de paradigme a conduit à un consensus préliminaire au sein de l'industrie sur l'importance de la chaîne de pensée. Des recherches techniques approfondies ont été publiées pour aider les entreprises à maintenir la transparence de cette chaîne plus longtemps que ce qui était auparavant possible.
Renforcement du Cadre de Sécurité Frontière
Google DeepMind a également renforcé son Cadre de Sécurité Frontière (FSF), devenant la première entreprise à inclure une section dédiée au désalignement dans un tel cadre. Au cours des deux dernières années, l'étendue de ce cadre s'est considérablement élargie, impliquant de nombreuses équipes au sein de Google. Le FSF a joué un rôle crucial dans le maintien de la vigilance de Google face aux risques graves, en développant des mesures d'atténuation bien avant qu'elles ne soient nécessaires.
Planification Technique et Documents Stratégiques
Pour structurer ses efforts, l'équipe a publié des documents clés tels que "An Approach to Technical AGI Safety and Security" et la "Feuille de Route de Contrôle de l'IA GDM". Ces publications détaillent les domaines spécifiques sur lesquels il est préférable de se concentrer en matière de sécurité et de contrôle de l'AGI. Elles se sont révélées très utiles pour organiser le travail interne et garantir que les efforts progressent vers les objectifs appropriés.
Contrôle et Monitorabilité des Agents
Le suivi des agents est devenu une priorité, car il pourrait bientôt être nécessaire en pratique. Bien que la chaîne de pensée ait été jugée peu fiable pour des tâches simples, elle est cruciale pour des tâches complexes nécessitant un raisonnement approfondi. L'équipe a coécrit "Chain-of-Thought Monitorability: A New and Fragile Opportunity for AI Safety", soulignant l'importance de cette approche. Des évaluations de capacités pour la furtivité et la conscience situationnelle ont également été développées pour évaluer la capacité des modèles à échapper aux moniteurs.
Alignement Profond : Une Nouvelle Approche
L'Alignement Profond est un domaine relativement nouveau pour l'équipe, qui s'adapte à cette phase intermédiaire. Historiquement, l'équipe s'est concentrée sur des approches conceptuelles, mais elle a récemment adopté une nouvelle stratégie. Les modèles actuels sont considérés comme suffisamment similaires aux futurs systèmes d'IA pour que les progrès réalisés aujourd'hui soient transférables. Des travaux d'analyse post-formation, tels que "SFT Drives Gemini’s Safety Properties" et "Why Do Naive SFT Filters For Safety Properties Fail?", ont été menés pour explorer ces dynamiques.
Amélioration de l'Interprétabilité des Modèles de Langage
La recherche sur l'interprétabilité des modèles de langage vise à approfondir la compréhension scientifique des modèles et à utiliser cette compréhension pour accroître leur sécurité. Une approche pragmatique a été adoptée pour résoudre directement des problèmes importants liés à l'interprétabilité. Des outils et des infrastructures ont été développés pour soutenir la recherche interne et l'écosystème externe, avec des publications sur la construction de probes prêtes pour la production.
Avancées en Supervision Amplifiée
Le travail sur la Supervision Amplifiée vise à permettre à des superviseurs faibles de fournir de bonnes incitations à des systèmes d'IA puissants pendant l'entraînement. Cela pourrait potentiellement permettre d'aligner des systèmes d'IA surhumains. La majorité des efforts se concentrent sur des travaux empiriques sur diverses formes de débat, cherchant à aligner les systèmes d'IA sur des objectifs humains.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.