Compression des prompts : optimiser les LLM sans sacrifier l'essentiel

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Compression des prompts : optimiser les LLM sans sacrifier l'essentiel
Qu'est-ce que la compression des prompts ?
La compression des prompts est le processus de raccourcissement d'un prompt sans enlever les informations nécessaires pour accomplir la tâche. Elle supprime le contenu répété, non pertinent ou de faible valeur tout en conservant les instructions principales, les faits importants et le contexte utile.
L'objectif n'est pas de créer le prompt le plus court possible, mais de réduire le nombre de tokens sans diminuer la qualité des réponses. Un prompt bien compressé doit toujours aider le modèle à comprendre la tâche, à suivre les instructions et à produire une réponse précise.
Types de techniques de compression des prompts
La compression des prompts peut être réalisée de plusieurs manières. Certaines méthodes suppriment des phrases ou des documents entiers, tandis que d'autres raccourcissent des phrases, retirent des tokens de faible valeur ou réécrivent le contexte complet sous forme de résumé.
Les principales techniques incluent :
-
Réécriture manuelle des prompts
La réécriture manuelle des prompts est la technique de compression la plus simple. Elle supprime les instructions répétées, les mots de remplissage et les explications inutiles.
Version compressée :
Répondez en utilisant uniquement le contexte fourni.
Cette méthode fonctionne bien pour les prompts système, les modèles réutilisables, les prompts d'évaluation et les instructions d'outil. Cependant, elle nécessite un effort manuel et peut ne pas bien s'adapter à des entrées volumineuses ou changeantes. -
Compression structurelle
La compression structurelle transforme un long texte en un format compact. Elle utilise des listes à puces, des tableaux, des paires clé-valeur, JSON ou YAML.
Version compressée :
plan : Gold
durée_mois : 18
dépense_mensuelle : 240
contacts_support_30j : 5
Cette méthode est efficace pour les dossiers clients, les réclamations, les détails de produits et les sorties d'outils. -
Filtrage au niveau des phrases
Le filtrage au niveau des phrases supprime les phrases complètes qui ne sont pas pertinentes pour la tâche. Il conserve uniquement les phrases qui aident à répondre à la question de l'utilisateur.
Cette technique est utile dans les systèmes RAG, les rapports, les politiques et les longues conversations. -
Compression au niveau des phrases
La compression au niveau des phrases retire les mots inutiles d'une phrase tout en conservant son sens principal.
Version compressée :
La demande a été soumise après la date limite et ne peut pas être traitée.
Cette méthode garde le texte lisible et réduit l'utilisation des tokens. -
Filtrage au niveau des tokens
Le filtrage au niveau des tokens supprime des mots ou des tokens individuels qui ont peu de valeur.
Version compressée :
Client, adhésion Gold, cinq contacts au support le mois dernier.
Cette méthode peut réduire les prompts de manière plus agressive que le filtrage au niveau des phrases. -
Compression extractive
La compression extractive sélectionne les parties les plus importantes du prompt original.
Cette méthode est utile pour les systèmes RAG, l'analyse de documents et les applications basées sur des politiques. -
Compression abstraite
La compression abstraite réécrit un contenu long en un résumé plus court.
Cette méthode est utile pour l'historique des discussions, les rapports, les notes de réunion et les longs documents. -
Compression consciente de la requête
La compression consciente de la requête conserve les informations en fonction de la question actuelle de l'utilisateur.
Cette technique est très utile dans les systèmes RAG et pour répondre à des questions sur des documents. -
Compression grossière à fine
La compression grossière à fine réduit un prompt en plusieurs étapes.
Cette méthode offre un meilleur contrôle sur la compression. -
Compression douce des prompts
La compression douce des prompts convertit un long texte en un petit ensemble de vecteurs appris.
Cette méthode peut réduire considérablement la taille du contexte.
Compression des prompts dans les systèmes RAG
La compression des prompts est très utile dans la génération augmentée par récupération (RAG). Un système RAG récupère des documents et les ajoute au prompt avant de générer une réponse.
Une pipeline RAG compressée fonctionne de la manière suivante :
La compression peut retirer des documents non pertinents, sélectionner des paragraphes importants et conserver uniquement les phrases qui soutiennent la réponse.
Compression des prompts pour les agents IA
Les agents IA construisent souvent de longs prompts au fil du temps. La compression des prompts aide les agents à ne garder que les informations nécessaires pour l'étape suivante. Les sorties d'outils anciennes peuvent être résumées, les actions complètes peuvent être stockées sous forme de mises à jour d'état courtes, et les instructions répétées peuvent être supprimées.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.