Cinq leviers éprouvés pour améliorer des prompts LLM

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Rendre une sortie de modèle utile ne relève pas d’une formule magique mais d’ajustements mesurables. Cinq techniques, testées sur une transcription de réunion avec réattributions et zones d’ombre, montrent où agir : structure de sortie, rôle, exemples, raisonnement et optimisation itérative. L’objectif n’est pas un texte plus joli, mais une réponse qu’un système peut valider et ingérer.
Raisonner à moindre coût et cibler les ambiguïtés
Demander un raisonnement étape par étape n’a plus le même poids sur les modèles récents qui raisonnent déjà en interne, contrairement aux gains spectaculaires observés en 2022 et 2023. Là où il reste décisif, c’est sur les zones grises, comme la réattribution d’une tâche dans une transcription. Sans invitation explicite à raisonner, un modèle peut retenir la première attribution formulée par Priya et ignorer la correction survenue plus tard. Un prompt qui impose de tracer les attributions au fil de l’échange et de ne garder que le propriétaire final cible précisément cette ambiguïté. Pour maîtriser les coûts, une variante appelée Chain of Draft demande des étapes d’environ cinq mots ; des travaux indiquent qu’elle peut atteindre la même exactitude que le raisonnement complet avec seulement 7,6 % des tokens de raisonnement, à utiliser dès lors que l’intérêt du raisonnement est établi.
Automatiser l’optimisation des prompts au lieu d’itérer à l’instinct
Plutôt que d’affiner un prompt à tâtons, l’optimisation automatisée et itérative évalue des variantes sur des cas de test réels et laisse un processus de recherche identifier les correctifs utiles. Des fragments types montrent les axes concrets à explorer : utiliser le propriétaire final quand une attribution change, fusionner une tâche intégrée ultérieurement dans un item existant sans dupliquer, ou encore inscrire « non assigné » quand aucun propriétaire n’est explicitement nommé. Cette approche transforme l’amélioration en un problème mesurable, reproductible et comparable.
Composer des exemples qui enseignent des motifs différents
La qualité des démonstrations influe souvent davantage que la seule tournure des instructions, et les combiner est plus efficace que l’une ou l’autre isolément. Le piège classique consiste à rassembler trois variantes d’un même motif, qui n’apportent presque rien. Un algorithme de sélection diversifiée basé sur TF‑IDF et similarité cosinus permet de maximiser la dissemblance entre exemples. Sur un test, choisir naïvement les trois premiers candidats a gardé deux quasi‑duplicatas ; la sélection consciente a repéré la paire et l’a remplacée par un cas réellement différent. Pour l’extraction d’actions dans une réunion, un trio pertinent doit couvrir trois motifs distincts : un propriétaire confirmé, un explicitement non résolu, et un item fusionné dans un précédent.
Demander un format précis permet une vérification automatique
La spécification d’un format de sortie mesurable change la donne. Demander de « lister des actions » produit une prose lisible mais inutilisable par un système en aval ; en production, l’absence de parse fiable est un échec. En validant une réponse JSON contre un schéma Pydantic (ActionItem et ActionItemList) via une fonction de parsing dédiée, la prose numérotée échoue à l’analyse alors que la même information, générée selon le schéma, passe et se matérialise en trois objets validés. La différence concrète est une sortie immédiatement exploitable par le code plutôt qu’un texte à ressaisir manuellement.
Orienter le modèle par un rôle attentif aux réattributions
Cadrer le système dans un rôle précis active des comportements d’entraînement utiles à la tâche. Se présenter comme un assistant exécutif méticuleux, rompu aux réattributions et à l’interdiction de deviner un propriétaire, amène des sorties plus structurées qu’une simple injonction générique. À l’inverse, une instruction vague ne signale ni la nécessité de surveiller les changements d’attribution ni le statut « non assigné » lorsqu’il est explicite, ce qui favorise les erreurs d’interprétation.
Le cas test : une réunion avec réattributions, intégration et inconnue
Le scénario d’évaluation s’appuie sur une réunion où trois situations compliquent l’extraction fiable d’actions. La revue de la mise en page mobile passe de Priya à Jake, qui s’engage à la finaliser d’ici jeudi, après que Tom a indiqué le besoin de revue avant vendredi. La vérification du point de rupture tablette est intégrée dans cette même revue, à la suite d’une plainte antérieure, et non isolée en tâche séparée. Par ailleurs, le triage de la file de support, qui compte environ 40 tickets à traiter cette semaine, reste sans propriétaire désigné après que Priya a exclu Tom et Jake et s’est réservée la désignation depuis la rotation. Le traitement de la migration de facturation est gelé tant que Tom n’a pas lu le changelog d’un correctif de sécurité récent, lecture qu’il dit prévoir le lendemain matin. Ces variations et inconnues forment le terrain d’essai des stratégies précédentes.
Pourquoi ces techniques s’appliquent à l’optimisation, pas à la conception
La distinction entre ingénierie et optimisation de prompt n’est pas théorique. La plupart des équipes disposent déjà d’un prompt utile et cherchent des gains concrets sans toucher au modèle. Les cinq leviers décrits — structure de sortie, rôle, sélection d’exemples, raisonnement ciblé et optimisation itérative — s’inscrivent précisément dans ce cadre : ils affinent un prompt existant, selon des critères vérifiables et des mesures tangibles.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.