Brief IA

ContextFusion réduit 60 à 99 % des tokens en optimisant le contexte

🔬 Research·Tom Levy·

ContextFusion réduit 60 à 99 % des tokens en optimisant le contexte

ContextFusion réduit 60 à 99 % des tokens en optimisant le contexte
Key Takeaways
1ContextFusion optimise le contexte envoyé aux LLM grâce à un planificateur multi-objectifs et des représentations compactes
2L’outil revendique une réduction de 60 à 99 % des tokens sans perte de qualité, avec benchmarks publiés
3Il propose des intégrations NPM, Python et Docker, une interface transparente et précise ses limites côté latence
💡Why it mattersLa gestion efficace du contexte permet de réduire les coûts et la latence des applications LLM tout en maintenant la qualité des réponses.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Un nouvel outil vise à rationaliser ce qui est envoyé aux modèles de langage en ne gardant que l’essentiel. Il combine représentations compactes, sélection contrainte par budget et adaptations multi-fournisseurs. Des coupes de 60 à 99 % de tokens ont été réalisées, avec des précisions sur les cas où l’approche n’est pas adaptée.

Sélection contrainte, cache et deltas pour limiter le volume utile

L’assemblage sensible au cache distingue les éléments stables, comme les instructions système, les cartes de citation et les blocs réutilisables, des contenus dynamiques tels que les données volatiles ou en temps réel. En mode agent, la fusion des deltas permet d’identifier les ajouts, mises à jour, suppressions et éléments inchangés pour optimiser la réutilisation du cache. Une couche de compression propose plusieurs niveaux, allant de la minification JSON à l’élagage de champs et au compactage des citations en identifiants. Le cœur d’optimisation repose sur un problème NP-difficile, mais l’outil annonce des temps d’exécution inférieurs à 100 ms pour des charges typiques grâce à l’indexation et à des heuristiques. ContextFusion précise cependant que l’optimisation ajoute un surcoût de 50 à 200 ms, ce qui le rend inadapté au streaming en temps réel nécessitant une latence inférieure à 100 ms. En amont, la récupération s’effectue par classification de la requête, une recherche lexicale top-100, puis un rerank rapide pour constituer le jeu de candidats.

Périmètre d’usage : multi-fournisseurs, coûts serrés et agents, avec des limites

ContextFusion est présenté comme pertinent pour les configurations multi-fournisseurs, permettant d’utiliser un même pipeline avec des formats de sortie adaptés à chaque fournisseur. Il est également mis en avant pour la production où la maîtrise des coûts est essentielle, avec une réduction revendiquée de 60 à 99 % des tokens. La gestion des conversations d’agents bénéficie de la fusion des deltas, qui vise à éviter le gaspillage de contexte répété. L’outil prend en charge l’unification de sources hétérogènes comme les PDFs, images, code et tableurs, et répond aux exigences de latence grâce au précalcul et à la mise en cache. ContextFusion précise toutefois qu’il peut être superflu pour des cas simples de question-réponse à un tour avec de petits documents, si l’on utilise déjà un cadre RAG satisfaisant, ou si l’on a besoin de streaming en temps réel avec une latence inférieure à 100 ms, en raison du surcoût d’optimisation de 50 à 200 ms.

Le problème traité : budgets serrés, risques, cache et diversité

Le projet met en avant les limites d’une approche basée uniquement sur la similarité sémantique, notamment lorsque le budget est de 4000 tokens face à 50 morceaux pertinents de 500 tokens chacun. Certains éléments peuvent présenter à la fois une utilité élevée et un risque important, comme une documentation obsolète. D’autres sont réutilisables via le cache, tandis que certains doivent rester frais. La diversité est également recherchée pour éviter d’envoyer plusieurs versions d’une même information. Le planificateur multi-objectifs de ContextFusion formule la sélection comme une optimisation sous contrainte, pondérant utilité, risque, coût en tokens, latence, cacheabilité et diversité dans la limite d’un budget. Cette approche s’appuie sur un knapsack 0/1 appliqué aux variantes de représentation par bloc.

Chaîne technique : ingestion, normalisation, représentations et adaptation fournisseur

La chaîne de traitement débute par l’ingestion de formats variés, dont PDF, DOCX, CSV, JSON, images via OCR, code et Markdown. Une étape de normalisation convertit toutes les sources en objets ContextBlock avec des champs communs comme le type de source, le hash de contenu, la date de création et des métadonnées. La couche de représentation précalcule des variantes compactes pour chaque bloc, telles que universal_summary, qa_extractive, code_signature et agent_condensed. Le pipeline stocke ensuite empreintes, résumés, statistiques de tokens, caractéristiques de récupération et variantes compactes dans un dossier de cache. Les charges utiles sont compilées selon le fournisseur ciblé, par exemple au format chat.completions pour OpenAI, avec citations XML pour Anthropic, via l’API locale pour Ollama ou un wrapper openai_compatible. La récupération prépare un ensemble de candidats par une approche lexicale suivie d’un rerank rapide.

Transparence et résultats revendiqués, avec benchmarks publiés

L’interface Web de ContextFusion affiche des métriques détaillées telles que les fichiers ingérés, les blocs sélectionnés et le volume total de tokens, ainsi que les variantes compactes retenues. Pour chaque bloc, elle indique la source, le type de représentation, le score d’utilité et l’estimation du nombre de tokens. Un aperçu exact du contexte transmis au modèle est proposé, ainsi qu’une comparaison optionnelle de la réponse du modèle. Un niveau de transparence rare a été mis en avant par rapport à la plupart des outils RAG, souvent perçus comme des boîtes noires. Ils revendiquent une réduction de 60 à 99 % des tokens sans perte de qualité de réponse. Des benchmarks ont été réalisés avec Claude Sonnet 4.6 sur des charges proches de la production, avec une méthodologie accessible publiquement.

Prise en main : NPM, Python, Docker et exemple de configuration

Pour JavaScript, un wrapper NPM sans dépendance Python permet une installation et une configuration via npx, la création d’un fichier de clés API et l’exécution d’optimisations, notamment avec le provider anthropic et le modèle claude-sonnet-4-6, ainsi que le lancement d’une interface web sur un port défini. En Python, le package context-portfolio-optimizer s’installe via pip, se configure avec un fichier .env, puis s’exécute en ligne de commande avec un budget de tokens et des requêtes ou tâches spécifiques, comme l’explication de fonctions de code, y compris avec gpt-5-mini et des budgets paramétrés. Une image Docker peut être construite et lancée pour traiter des données avec un budget donné. Un exemple de code illustre l’intégration via PipelineRunner et AnthropicAdapter, avec une configuration YAML détaillant des budgets par catégories et des poids de scoring, et l’utilisation du modèle claude-sonnet-4-6 sur des sources mêlant PDF, code Python et CSV. L’outil met en avant l’ingestion de formats variés, la gestion de deltas en conversation et une sélection contrainte par budget.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.