Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
L'importance cruciale de la surveillance des agents IA
Avec l'évolution rapide des agents d'intelligence artificielle, capables désormais d'accomplir des tâches de plus en plus complexes de manière autonome, la nécessité de surveiller leur comportement devient primordiale. Dans le cadre d'une approche de déploiement itératif, il est essentiel de comprendre comment ces systèmes se comportent dans des environnements réels. Cela permet d'ajuster continuellement les mesures de sécurité en fonction des avancées technologiques. Pour soutenir cette démarche, une stratégie de défense en profondeur est mise en place, intégrant plusieurs couches de sécurité complémentaires. Parmi celles-ci figurent la formation à la sécurité, les tests comportementaux, la révision de code agentique, et la surveillance de la chaîne de pensée (CoT). Cette dernière consiste à analyser les étapes de raisonnement générées par les agents lors de l'exécution de tâches. Ces traces de raisonnement fournissent des signaux précieux, tant au cours de la formation que du déploiement, aidant à identifier les comportements potentiellement dangereux ou incohérents avec les objectifs fixés par l'utilisateur.
Les défis de la surveillabilité des modèles de raisonnement
Actuellement, le raisonnement des modèles est généralement interprétable et facile à surveiller. Cependant, cette capacité de surveillance pourrait se détériorer à l'avenir pour diverses raisons. Un scénario préoccupant serait que les agents deviennent capables de modifier ou d'obscurcir délibérément leur raisonnement lorsqu'ils savent qu'ils sont surveillés. Cela pourrait conduire à une surestimation de l'alignement ou de la sécurité d'un système, rendant les systèmes de surveillance moins fiables. Dans cette étude, nous examinons si les modèles de raisonnement actuels peuvent contrôler leur chaîne de pensée de manière à réduire leur surveillabilité. Comprendre cette capacité est crucial pour garantir que la surveillance de la CoT reste une protection robuste à mesure que les systèmes IA gagnent en performance. Les résultats montrent que les modèles actuels peinent à contrôler leurs CoTs, même lorsqu'ils sont informés de la surveillance. Bien que la contrôlabilité soit plus élevée pour les modèles plus grands, elle diminue lorsque les modèles sont sollicités pour raisonner plus longtemps ou subissent des ajustements après formation. Ces observations suggèrent que la contrôlabilité de la CoT ne constitue pas actuellement un risque majeur pour la surveillabilité, bien qu'une évaluation continue soit nécessaire à mesure que les modèles évoluent.
Définition de la "contrôlabilité de la CoT"
La chaîne de pensée désigne les étapes intermédiaires de raisonnement qu'un agent IA génère lors de la résolution d'une tâche. Ces traces de raisonnement fournissent des signaux de sécurité utiles, aidant les systèmes de surveillance à évaluer si le comportement d'un agent est sûr ou aligné. La contrôlabilité de la CoT est la capacité d'un modèle de raisonnement à manipuler les propriétés de sa CoT de manière à réduire sa surveillabilité. Mesurer cette capacité dans le cadre des incitations réalistes à éviter les surveillants est complexe. Nous utilisons donc un proxy pratique : la capacité du modèle à suivre les instructions de l'utilisateur concernant sa CoT. Par exemple, nous testons si un modèle peut suivre des instructions affectant son raisonnement interne, comme utiliser uniquement des lettres minuscules, éviter certains mots-clés, ou ajouter des phrases spécifiques, plutôt que de simplement modifier sa sortie visible.
Lancement de CoT-Control
Pour approfondir cette étude, nous avons introduit CoT-Control, une suite d'évaluation open-source conçue pour mesurer la contrôlabilité de la CoT des modèles de raisonnement. CoT-Control comprend plus de 13 000 tâches basées sur des benchmarks établis tels que GPQA, MMLU-Pro, HLE, BFCL, et SWE-Bench Verified. Chaque tâche est créée en associant un problème de benchmark avec une instruction de CoT, comme éviter certains mots-clés pertinents pour le problème dans la CoT, utiliser uniquement des lettres minuscules, ou ajouter un mot donné à chaque phrase.
Résultats : une faible contrôlabilité de la CoT
Les évaluations menées sur 13 modèles de raisonnement révèlent qu'ils ont tous du mal à contrôler de manière fiable leurs CoTs. Nous mesurons la contrôlabilité comme la fraction des traces de raisonnement où le modèle se conforme avec succès aux instructions de CoT. Dans l'ensemble des modèles de pointe, les scores de contrôlabilité de la CoT sont faibles, variant de 0,1 % et ne dépassant pas...

