⚡
Brief IA
›

LLM : le cache coûte 10 fois moins, évitez le double péage

🔬 Research·Tom Levy·

LLM : le cache coûte 10 fois moins, évitez le double péage

LLM : le cache coûte 10 fois moins, évitez le double péage
⚡
Key Takeaways
1Les tokens mis en cache coûtent un dixième du prix normal, mais la fenêtre de cache varie selon l’outil (1 h pour les apps Claude, 5 min pour l’API Anthropic, 5–10 min pour ChatGPT, 30 min pour l’API OpenAI)
2Un écart de 10x sépare les modèles les moins chers des plus chers chez un même fournisseur
3Les sous-agents et l’historique rejoué hors cache peuvent faire exploser la facture
4Adapter le modèle, limiter le contexte et rester dans la fenêtre de cache permet de maîtriser les coûts
💡Why it matters — Les budgets IA sont rapidement épuisés si l’on ignore la gestion du cache, la sélection du modèle et la discipline sur le contexte et les outils.
⚡Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Des écarts de prix de 10x séparent les modèles d’une même gamme et les tokens mis en cache valent un dixième des tokens normaux. Entre minuteries de cache variables et historique rejoué, une partie des budgets IA fond dès le printemps. Des règles d’usage et un choix de modèle par palier permettent de contenir la facture sans sacrifier les résultats.

Déléguer aux sous-agents sans perdre l’économie du cache

Si l’agent principal fonctionne sur l’API d’Anthropic, sa fenêtre de mise en cache est de 5 minutes. Un sous-agent qui met 7 minutes à répondre fait expirer ce cache et impose au manager de recomputer tout son contexte, avec un coût qui peut dépasser l’économie attendue. Il est donc recommandé de ne déléguer que des tâches qui se terminent de manière fiable dans la fenêtre de cache. Les sous-agents ont la réputation de brûler les budgets, et demander à mille agents de plancher sur un slogan peut coûter mille fois plus qu’un seul. Bien utilisés, ils peuvent pourtant réduire les coûts : traiter l’agent principal comme un manager senior, confier aux sous-agents des tâches claires avec juste assez de contexte — résumer un fichier, trancher oui/non, fouiller un dossier ou une base et rapporter le pertinent — permet d’exécuter ces étapes sur des modèles moins chers et de garder le contexte du manager concentré et léger.

Tarifs : sorties plus chères et écart de 10x entre modèles

Chaque appel API facture des tokens entrants et sortants, la sortie étant la plus coûteuse. Exemple cité chez Anthropic : Claude Fable 5 à 10 $ par million de tokens en entrée et 50 $ par million en sortie. Dans cette gamme, Fable coûte le double d’Opus, lui-même cinq fois plus cher que Haiku, soit un écart de 10x entre le modèle le moins cher et le plus cher. Ces tarifs évoluent et nécessitent une vérification chez le fournisseur. À l’inverse, les tokens mis en cache sont facturés un dixième du prix normal, un levier majeur pour abaisser la note.

Pourquoi l’historique fait grimper la note

Conserver les calculs d’un échange coûte au fournisseur, qui limite la durée de mise en cache avec un minuteur propre à chaque outil : 1 heure pour les apps Claude sur abonnement, 5 minutes pour l’API Anthropic, environ 5 à 10 minutes pour ChatGPT et 30 minutes pour l’API OpenAI. Sans mise en cache, le modèle rejoue toute la conversation à chaque tour et l’on repaye l’historique en entrée comme en sortie. La mise en cache stocke ces calculs et, lorsqu’elle est chaude, évite ces recomputations, ne traitant que la partie nouvelle. Chaque utilisation réinitialise le minuteur et la conversation peut rester chaude indéfiniment tant qu’elle avance, par exemple toute l’après-midi dans une fenêtre d’une heure. À l’inverse, ouvrir plusieurs onglets et revenir des heures plus tard laisse l’historique visible mais fait perdre le cache, forçant un recalcul complet coûteux. Poser une question par jour dans un même fil peut ainsi coûter plusieurs fois plus que regrouper sept questions espacées de cinq minutes.

Rester dans la fenêtre, écrire court, limiter le contexte et les outils

Identifier sa fenêtre de cache et réaliser ses allers-retours à l’intérieur évitent des recomputations. Ne pas laisser une tâche inachevée dépasser cette fenêtre est essentiel. Parce que toute la conversation est rejouée lorsque le cache manque, chaque phrase inutile pèse de manière récurrente ; une session concise coûte moins qu’une session verbeuse. Réduire ses messages, demander des réponses brèves, garder des instructions et invites courtes, et réclamer des sorties en Simplified Technical English (norme ASD-STE100) aident à contenir les tokens. Surcharger le contexte dégrade la qualité et augmente la facture ; mieux vaut ne fournir que l’indispensable. Enfin, activer trop d’outils allonge l’invite système et multiplie les risques d’appels inutiles. Quand la tâche change, il est préférable d’ouvrir un nouveau chat : deux échanges courts et ciblés sont plus économiques et souvent plus efficaces qu’un long fil décousu.

Choisir le bon palier et payer le raisonnement seulement quand il sert

Il n’est pas recommandé d’envoyer toutes les tâches au modèle le plus cher. Les fournisseurs proposent des paliers : chez Anthropic, Haiku, Sonnet, Opus, Fable ; chez OpenAI, la famille GPT-5.6 avec Luna, Terra, Sol. Pour les charges légères (tri, étiquetage, extraction, résumés), des modèles comme Haiku ou Luna suffisent ; pour le milieu de gamme (code, documents, analyses légères), Sonnet ou Terra ; pour l’analyse approfondie ou la coordination d’agents, Opus, Fable ou Sol. Les modèles légers ne raisonnent pas toujours par défaut ; ceux qui raisonnent écrivent une chaîne de pensée privée, ce qui a soutenu les progrès récents mais ajoute du coût. Pour étiqueter 500 e-mails, ce raisonnement est superflu. Prendre deux secondes pour jauger la difficulté avant d’appuyer sur Entrée aide à choisir le bon modèle, prolongeant l’abonnement ou le budget API. Toutes les tâches n’ont pas besoin d’un haut de gamme.

Pourquoi les budgets fondent : agents, étapes et prix mouvants

Beaucoup d’entreprises ont déjà entamé à l’excès leur enveloppe d’IA, certaines l’ayant vidée dès avril, parfois en un trimestre. Cette situation s’explique par la fréquence d’utilisation, mais surtout par la transformation des usages : on observe un passage des chatbots à des agents qui utilisent successivement des outils, lisent des fichiers et effectuent des vérifications, chaque phase impliquant une consommation de tokens. Une demande adressée à un agent peut représenter un coût plusieurs fois supérieur à celui d’une simple interaction. Les prix, quant à eux, évoluent : les abonnements, l’API à la demande, les offres promotionnelles ponctuelles et l’arrivée de nouveaux modèles premium se multiplient, ce qui complique le suivi. Comprendre précisément ce qui est facturé — y compris qu’un mot n’est pas un token, qu’on peut compter environ 1,33 tokens par mot et que les segmentations varient selon le modèle — devient un préalable pour reprendre la main sur la dépense.

⚡

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.