La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des écarts de prix de 10x séparent les modèles d’une même gamme et les tokens mis en cache valent un dixième des tokens normaux. Entre minuteries de cache variables et historique rejoué, une partie des budgets IA fond dès le printemps. Des règles d’usage et un choix de modèle par palier permettent de contenir la facture sans sacrifier les résultats.
Déléguer aux sous-agents sans perdre l’économie du cache
Si l’agent principal fonctionne sur l’API d’Anthropic, sa fenêtre de mise en cache est de 5 minutes. Un sous-agent qui met 7 minutes à répondre fait expirer ce cache et impose au manager de recomputer tout son contexte, avec un coût qui peut dépasser l’économie attendue. Il est donc recommandé de ne déléguer que des tâches qui se terminent de manière fiable dans la fenêtre de cache. Les sous-agents ont la réputation de brûler les budgets, et demander à mille agents de plancher sur un slogan peut coûter mille fois plus qu’un seul. Bien utilisés, ils peuvent pourtant réduire les coûts : traiter l’agent principal comme un manager senior, confier aux sous-agents des tâches claires avec juste assez de contexte — résumer un fichier, trancher oui/non, fouiller un dossier ou une base et rapporter le pertinent — permet d’exécuter ces étapes sur des modèles moins chers et de garder le contexte du manager concentré et léger.
Tarifs : sorties plus chères et écart de 10x entre modèles
Chaque appel API facture des tokens entrants et sortants, la sortie étant la plus coûteuse. Exemple cité chez Anthropic : Claude Fable 5 à 10 $ par million de tokens en entrée et 50 $ par million en sortie. Dans cette gamme, Fable coûte le double d’Opus, lui-même cinq fois plus cher que Haiku, soit un écart de 10x entre le modèle le moins cher et le plus cher. Ces tarifs évoluent et nécessitent une vérification chez le fournisseur. À l’inverse, les tokens mis en cache sont facturés un dixième du prix normal, un levier majeur pour abaisser la note.
Pourquoi l’historique fait grimper la note
Conserver les calculs d’un échange coûte au fournisseur, qui limite la durée de mise en cache avec un minuteur propre à chaque outil : 1 heure pour les apps Claude sur abonnement, 5 minutes pour l’API Anthropic, environ 5 à 10 minutes pour ChatGPT et 30 minutes pour l’API OpenAI. Sans mise en cache, le modèle rejoue toute la conversation à chaque tour et l’on repaye l’historique en entrée comme en sortie. La mise en cache stocke ces calculs et, lorsqu’elle est chaude, évite ces recomputations, ne traitant que la partie nouvelle. Chaque utilisation réinitialise le minuteur et la conversation peut rester chaude indéfiniment tant qu’elle avance, par exemple toute l’après-midi dans une fenêtre d’une heure. À l’inverse, ouvrir plusieurs onglets et revenir des heures plus tard laisse l’historique visible mais fait perdre le cache, forçant un recalcul complet coûteux. Poser une question par jour dans un même fil peut ainsi coûter plusieurs fois plus que regrouper sept questions espacées de cinq minutes.
Rester dans la fenêtre, écrire court, limiter le contexte et les outils
Identifier sa fenêtre de cache et réaliser ses allers-retours à l’intérieur évitent des recomputations. Ne pas laisser une tâche inachevée dépasser cette fenêtre est essentiel. Parce que toute la conversation est rejouée lorsque le cache manque, chaque phrase inutile pèse de manière récurrente ; une session concise coûte moins qu’une session verbeuse. Réduire ses messages, demander des réponses brèves, garder des instructions et invites courtes, et réclamer des sorties en Simplified Technical English (norme ASD-STE100) aident à contenir les tokens. Surcharger le contexte dégrade la qualité et augmente la facture ; mieux vaut ne fournir que l’indispensable. Enfin, activer trop d’outils allonge l’invite système et multiplie les risques d’appels inutiles. Quand la tâche change, il est préférable d’ouvrir un nouveau chat : deux échanges courts et ciblés sont plus économiques et souvent plus efficaces qu’un long fil décousu.
Choisir le bon palier et payer le raisonnement seulement quand il sert
Il n’est pas recommandé d’envoyer toutes les tâches au modèle le plus cher. Les fournisseurs proposent des paliers : chez Anthropic, Haiku, Sonnet, Opus, Fable ; chez OpenAI, la famille GPT-5.6 avec Luna, Terra, Sol. Pour les charges légères (tri, étiquetage, extraction, résumés), des modèles comme Haiku ou Luna suffisent ; pour le milieu de gamme (code, documents, analyses légères), Sonnet ou Terra ; pour l’analyse approfondie ou la coordination d’agents, Opus, Fable ou Sol. Les modèles légers ne raisonnent pas toujours par défaut ; ceux qui raisonnent écrivent une chaîne de pensée privée, ce qui a soutenu les progrès récents mais ajoute du coût. Pour étiqueter 500 e-mails, ce raisonnement est superflu. Prendre deux secondes pour jauger la difficulté avant d’appuyer sur Entrée aide à choisir le bon modèle, prolongeant l’abonnement ou le budget API. Toutes les tâches n’ont pas besoin d’un haut de gamme.
Pourquoi les budgets fondent : agents, étapes et prix mouvants
Beaucoup d’entreprises ont déjà entamé à l’excès leur enveloppe d’IA, certaines l’ayant vidée dès avril, parfois en un trimestre. Cette situation s’explique par la fréquence d’utilisation, mais surtout par la transformation des usages : on observe un passage des chatbots à des agents qui utilisent successivement des outils, lisent des fichiers et effectuent des vérifications, chaque phase impliquant une consommation de tokens. Une demande adressée à un agent peut représenter un coût plusieurs fois supérieur à celui d’une simple interaction. Les prix, quant à eux, évoluent : les abonnements, l’API à la demande, les offres promotionnelles ponctuelles et l’arrivée de nouveaux modèles premium se multiplient, ce qui complique le suivi. Comprendre précisément ce qui est facturé — y compris qu’un mot n’est pas un token, qu’on peut compter environ 1,33 tokens par mot et que les segmentations varient selon le modèle — devient un préalable pour reprendre la main sur la dépense.






