Brief IA : Des chercheurs identifient des schémas internes lors du raisonnement des IA

Des chercheurs identifient des schémas internes lors du raisonnement des IA

Brief IA
Tom Levy·3 min·95 vues

Des chercheurs de KAIST et Naver AI Lab ont découvert que les opérations de raisonnement, comme la déduction et le calcul, laissent des signatures distinctes dans les états internes des modèles de langage, particulièrement dans les couches intermédiaires. Bien que cette séparation ait été validée sur plusieurs modèles et jeux de données, elle reste limitée aux tâches mathématiques. Cette cartographie pourrait améliorer la supervision et la sécurité des IA en reliant le texte produit aux calculs internes.

En bref
1Les opérations de raisonnement laissent des signatures distinctes dans les états internes de plusieurs modèles de langage
2La séparation est maximale dans les couches intermédiaires et ne s'explique pas par le choix des mots
3L'effet a été validé sur d'autres modèles et jeux de données, mais reste limité aux tâches mathématiques
💡Pourquoi c'est importantCette cartographie des étapes internes pourrait ouvrir de nouvelles pistes pour la supervision et la sécurité des IA, en reliant le texte produit au calcul interne.
Le brief IA que lisent les pros

L’IA et sa régulation t’intéressent ?

Lois, cadres et décisions qui façonnent l’IA, décryptés en français. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Des travaux menés par KAIST et Naver AI Lab indiquent que des opérations comme la déduction ou le calcul laissent une signature distincte dans les représentations internes de modèles de langage. L’effet culmine dans les couches intermédiaires, a été répliqué sur d’autres modèles et jeux de données, mais reste borné à des tâches mathématiques. Cette cartographie intéresse directement les approches de supervision et de sécurité qui lient texte produit et calcul interne.

Portée validée hors échantillon, limites assumées et enjeu sécurité

Des tests supplémentaires ont permis de vérifier la séparabilité des opérations de raisonnement. Ce phénomène a également été observé avec Llama-3-8B, et il a été possible de transférer avec succès des classificateurs formés sur Qwen3-8B vers GPQA-Diamond et MATH-500. Il est cependant précisé que les essais se concentrent sur des tâches mathématiques et un nombre limité de modèles, et que l'emploi de ces signaux pour repérer des erreurs ou orienter la génération reste à approfondir. Ce champ concerne directement la sécurité, la relation entre sortie textuelle et calcul interne étant jugée cruciale. OpenAI considère la lecture de la chaîne de pensée comme l'un des rares outils de supervision disponibles, tandis qu'Anthropic a montré que les modèles ne révèlent que 25 à 39 % des indices réellement utilisés. D'autres travaux indiquent que Claude Opus 4.6 traite plus d'informations que ce qui apparaît dans son raisonnement affiché, et que la Profondeur Récurrente dans Astra déplace une part du raisonnement vers des représentations internes, précisément l'espace exploré par cette étude.

Huit opérations, trois modèles et un étiquetage automatisé

Les chercheurs ont défini huit opérations récurrentes, telles que l'extraction, la décomposition, le rappel de formule, la déduction et le calcul. Ils ont soumis trois modèles (Qwen2.5-7B, Qwen3-8B et Gemma4-31B) à des problèmes mathématiques, puis ont segmenté les chemins de solution et étiqueté chaque segment à l'aide de GPT-5. L'objectif était de déterminer si les états internes du modèle retraçaient ces étapes. Ils constatent qu'un même type de réponse génère un motif d'activation distinct selon l'opération engagée, avec des regroupements cohérents dans l'espace de représentation.

Des signatures nettes au cœur du réseau, au-delà des mots utilisés

Les opérations de raisonnement sont distinguables de façon fiable dans les représentations internes des trois modèles, et la séparation atteint un maximum dans les couches intermédiaires. Les chercheurs ont écarté une explication par le simple choix des mots : un classificateur ne considérant que les tokens obtient de moins bons résultats qu'un autre exploitant les représentations internes. De même, la position d'un segment dans le chemin de solution n'explique pas la séparation. Les états internes portent donc des informations sur la nature de l'étape de raisonnement qui dépassent la surface textuelle, un effet particulièrement marqué dans les couches intermédiaires du réseau.

Même mot, rôle différent selon l’étape et dépendance au contexte

Des termes courants tels que « un », « est » ou « le » interviennent à des moments très variés du raisonnement. Dans les couches initiales, leurs représentations internes restent entremêlées, mais elles s'individualisent dans les couches intermédiaires et finales en fonction de l'opération réalisée. Un même terme reçoit ainsi une représentation interne distincte selon l'étape. Par intervention ciblée, les chercheurs ont bloqué l'attention sur les 30 tokens précédents : le signal de l'opération s'affaiblit, ce qui indique une dépendance au contexte. Enfin, même lorsque le problème est mal résolu, l'étape réalisée demeure identifiable, y compris pour un calcul erroné qui conserve sa signature interne de calcul.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires