La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un professeur de l’UCL, ancien membre clé d’AlphaGo, soutient que les modèles de langage ne disposent pas d’un véritable raisonnement. Il prône une architecture inspirée du jeu de Go, articulée autour d’un état épistémique explicite et d’un contrôle indépendant des preuves, pour des domaines sensibles comme la médecine ou la recherche.
Des décisions traçables exigées dans les usages à haut risque
Dans la médecine, l’ingénierie et la recherche scientifique, il ne suffit pas de connaître la conclusion d’un système : il faut pouvoir retracer le cheminement qui y a mené. Lorsqu’un diagnostic ou un traitement échoue, il doit être possible d’identifier si le raisonnement, les preuves mobilisées ou les hypothèses sont en cause. L’approche avancée requiert une entité indépendante qui évalue chaque étape selon sa contribution réelle à la réduction de l’incertitude, et n’autorise une mise à jour des croyances qu’étayée par des preuves. Les systèmes recherchés doivent produire des conclusions issues de séquences vérifiables de preuves, d’inférences et de révisions de croyances, condition jugée nécessaire pour des secteurs comme la découverte de médicaments, les matériaux, le climat ou le diagnostic. À l’inverse, accroître uniquement la partie intuitive d’un système ne suffirait pas à fiabiliser l’intelligence machine, l’échelle affinant l’intuition sans la rendre plus délibérative.
Une architecture de raisonnement centrée sur un état épistémique
Le dispositif proposé repose sur le maintien d’un état épistémique qui répertorie ce qui est établi, ce qui fait l’objet de doutes, ce qui a été écarté et les questions encore ouvertes. Le raisonnement y est envisagé comme une suite de coups modifiant cet état pour faire progresser la connaissance et réduire l’incertitude. Les avancées récentes des modèles neuronaux, y compris les LLM, sont considérées comme des instruments pour suggérer des approches au vu des connaissances et ressources disponibles, interagir avec des outils via des API ou du code et contribuer à l’évaluation d’assertions au regard des preuves disponibles. Avec des règles de validation et de mise à jour strictes, le système pourrait accumuler des connaissances certifiées et améliorer sa politique de raisonnement à partir de ses expériences, dans l’esprit d’une méthode scientifique amplifiée visant des savoirs résistants à l’examen.
Ce qu’AlphaGo a fait différemment : un arbre de jeu explicite
AlphaGo tenait un registre explicite de ce qu’il savait via un arbre de jeu. Chaque coup et chaque position étaient annotés par des jugements issus de ses réseaux neuronaux, puis l’arbre était continuellement mis à jour au fil du raisonnement avant de synthétiser ces informations pour choisir le coup à jouer. Des milliers de branches futures ont été explorées, complétant les intuitions fournies par les réseaux par une délibération structurée. Cette articulation entre intuitions et exploration explicite constitue le cœur de ce qui est présenté comme une véritable capacité de raisonner.
Les limites des LLM et des chaînes de pensée
Les modèles de langage opèrent par sélection itérative du prochain jeton, un fonctionnement rapproché d’un mode rapide et associatif. Après l’essor de ChatGPT, l’introduction de chaînes de pensée a apporté des progrès, en particulier en mathématiques et en programmation, mais sans établir un mécanisme séparé de délibération : les étapes intermédiaires restent générées par la même prédiction prolongée. Trois insuffisances sont relevées. D’abord, l’absence d’un état épistémique explicite, persistant et inspectable listant hypothèses, degrés de confiance, preuves et questions en attente, révisé au fil des informations. Ensuite, l’absence de séparation entre connaissances et procédures de manipulation, celles-ci demeurant entremêlées dans les poids du réseau plutôt que dans un ensemble de croyances représenté. Enfin, des travaux ont montré que les chaînes de pensée peuvent être produites après coup, parfois sous forme de récit ne reflétant pas le chemin de calcul réel.
Des matches historiques pour cadrer le débat
Deep Blue a vaincu Garry Kasparov en 1997 en évaluant 200 millions de positions par seconde tout en regardant six à huit coups à l’avance par joueur, selon des règles codées par des humains. Le Go présente une complexité différente, la valeur d’une pierre dépendant de la dynamique des groupes et du territoire sur des dizaines de coups, au point que calculer ne serait-ce qu’une fraction des possibilités exigerait des milliards d’années d’un superordinateur. AlphaGo associait un réseau de politique, qui estimait à environ une chance sur 10 000 la probabilité qu’un humain joue le coup 37, et une recherche explorant un arbre aux milliers de branches. Il a retenu ce coup alors qu’il paraissait peu plausible par simple intuition. Cette articulation rappelle la distinction popularisée par Daniel Kahneman entre pensée intuitive et pensée délibérative. La série s’est conclue par une victoire 4-1 d’AlphaGo, après un deuxième match marqué par un 37e coup sur la cinquième ligne qui a fait croire à certains commentateurs à un bug, quand Lee Sedol a ensuite qualifié la machine de créative.
L’auteur et sa trajectoire
Thore Graepel, titulaire de la chaire d’apprentissage machine à l’University College London et ancien membre clé de l’équipe AlphaGo chez DeepMind, indique avoir récemment quitté Google DeepMind. Il affirme œuvrer à ce que l’IA serve l’épanouissement humain. Sa position le conduit à défendre une nouvelle approche du raisonnement machine, en vue d’applications sensibles comme la découverte de médicaments, les matériaux, le climat ou le diagnostic.





