⚡
Brief IA
›

JEV : transformer un LLM ouvert en moteur de décision

💻 Code & Dev·Tom Levy·

JEV : transformer un LLM ouvert en moteur de décision

JEV : transformer un LLM ouvert en moteur de décision
⚡
Key Takeaways
1Remplacer la tête de génération d’un LLM par une tête de classification permet d’obtenir des décisions instantanées et structurées
2Qwen2.5-Coder-1.5B-Instruct sert de base open-source pour bâtir ce moteur de Système 1, avec trois scripts et un chargement ciblé
3Ce système accélère le routage de messages en support client, en évitant la latence des réponses textuelles
💡Why it matters — Cette approche permet d’intégrer la rapidité et la fiabilité du Système 1 dans les logiciels, là où les LLM classiques sont trop lents pour des décisions immédiates.
⚡Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Remplacer la tête de génération d’un modèle de langage par une tête de classification permet d’obtenir des décisions instantanées et structurées. Un squelette open-source comme Qwen2.5-Coder-1.5B-Instruct sert de base pour bâtir ce moteur de Système 1, pensé pour router et classer sans passer par des paragraphes bavards.

Remplacer la tête de génération par une tête de classification accélère la décision

La conversion d’un modèle de langage en moteur de décision passe par le remplacement de la tête de génération par une tête de classification. Ce changement transforme une opération en boucle lente en un passage unique. Le squelette traite le contexte en un seul parcours, puis la tête de classification canalise cette compréhension vers une décision finale, sans générer de mots. L’ordinateur ne parcourt plus le réseau à chaque token ; il exécute une fois et rend la décision en une fraction de seconde. Cette bascule d’un devineur de mots à un évaluateur à passage unique explique la rapidité et la nature de commutateur fiable du système. Dans cette architecture, le squelette — qui comprend le langage, le contexte et les nuances — reste identique. Ce n’est que la tête, interchangeable dans les architectures modernes, qui change d’objectif : au lieu de produire du texte, elle pousse un score mathématique à travers des catégories prédéfinies comme Vrai, Faux ou Spam.

Monter un JEV local avec Qwen2.5-Coder-1.5B-Instruct

La première étape consiste à choisir un squelette open-source. La famille Qwen est proposée comme candidate, avec des variantes très compactes adaptées à un ordinateur standard. Pour un moteur de décision rapide et local, une version compacte offre un compromis entre profondeur de compréhension et performances. L’exemple s’appuie sur Qwen2.5-Coder-1.5B-Instruct, un petit modèle déjà sensibilisé au code. Le projet présenté regroupe trois scripts, model.py, train.py et check_names.py, et s’installe via une simple commande pip. Le chargement du modèle implique de télécharger les poids et d’utiliser un tokenizer pour convertir le texte en unités lisibles. L’API AutoModel ne retient que le squelette, même si le bundle contient aussi la tête de génération de mots. Le premier lancement récupère les fichiers depuis Hugging Face ; les suivants réutilisent la copie locale. Un extrait de code illustre l’emploi d’AutoTokenizer et d’AutoModel avec l’identifiant Qwen/Qwen2.5-Coder-1.5B-Instruct. Une fois le squelette en place, il faut appliquer l’échange de tête décrit précédemment pour finaliser le moteur de classification.

Acheminer des messages en support client avec un commutateur déterministe

L’intérêt pratique est de bâtir des instructions conditionnelles intelligentes entre la rigueur des règles logicielles et la compréhension des LLM. Un cas d’usage typique est le support client. À la réception d’un message, avant d’activer un agent IA lent et coûteux, il s’agit d’identifier rapidement s’il s’agit d’un incident urgent, d’une question de facturation ou d’un spam. Un commutateur déterministe et rapide achemine la requête vers le bon traitement, sans attendre la rédaction d’un paragraphe explicatif. Le routage devient ainsi fiable et rapide, contribuant à des systèmes automatisés plus rapides, moins coûteux et moins sujets aux erreurs face aux données du monde réel.

Pourquoi la génération autoregressive limite la vitesse

Les transformateurs qui animent les chatbots procèdent par autocomplétion, en prédisant token après token jusqu’au mot d’arrêt. Cette boucle itérative est adaptée à la création de textes longs comme des poèmes ou du code, mais elle constitue un goulet d’étranglement lorsqu’il ne s’agit que de trancher une catégorie simple, par exemple signaler un spam. Même pour une telle étiquette, le modèle assemble une phrase complète, avec les aléas de formulation que cela comporte. Dans un pipeline logiciel, il faut alors attendre ce paragraphe, le lire et en extraire la décision, avec des latences, de l’imprévisibilité et des risques d’erreur si la tournure varie. Par contraste, un moteur JEV examine l’entrée en une passe et rend une décision structurée, sans construction de texte intermédiaire.

Fondements cognitifs : du Système 2 lent au Système 1 rapide

Le cadre théorique s’inspire des deux systèmes de pensée décrits par Daniel Kahneman. Le Système 2, lent et raisonné, ressemble au fonctionnement des chatbots modernes qui élaborent une réponse étape par étape. Le Système 1, rapide et intuitif, sert de modèle au comportement attendu d’un moteur de décision instantané. Jusqu’à récemment, les développeurs se reposaient sur des modèles de type Système 2, y compris pour des choix triviaux, faute d’alternative robuste. Le contraste entre un programme qui écrit sa réponse et un autre qui tranche en une étape éclaire l’ambition d’un moteur JEV : apporter au logiciel un jugement rapide, dans l’esprit du Système 1. Le livre Thinking, Fast and Slow, publié en 2011, popularise cette dichotomie cognitive.

Des règles si-alors face aux cas du monde réel

Les règles si-alors traditionnelles conviennent à des cas simples mais échouent sur des entrées ambiguës ou déformées, comme une carte postale, une enveloppe rembourrée ou une lettre froissée, faute de saisir le contexte. Les grands modèles de langage ont été mobilisés pour ce type d’informations désordonnées, grâce à leur compréhension du langage et des intentions, mais leurs réponses textuelles détaillées ne sont pas idéales pour des décisions binaires rapides. Un moteur JEV se concentre sur la décision structurée, par exemple une catégorie assortie d’un niveau de confiance, en évitant tout verbiage. Il conserve la compréhension d’un LLM tout en supprimant l’aspect conversationnel, ce qui contribue à réduire le temps de réponse.

⚡

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.