McKinsey encadre l'usage des tokens d'IA

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
La bascule vers la facturation à la consommation met les budgets IA sous tension. McKinsey dit privilégier la transparence et l'éducation, avec des alertes individuelles, une passerelle de prompts, des disjoncteurs et du caching. EY revendique 60 % de tokens en moins depuis avril, tandis que des développeurs chez Deloitte disent buter sur de nouveaux quotas. Debasish Patnaik recommande de mesurer le coût par résultat et d'encourager encore l'adoption.
Chez les pairs, coupes affichées et quotas ressentis
EY a mis en place un Bureau de Réalisation de Valeur de l'IA et un routeur invisible pour orienter les usages vers le modèle le plus adapté. D'après EY, ces outils ainsi que d'autres initiatives de gouvernance ont abouti à une diminution de 60 % de la consommation de tokens depuis le mois d'avril. Au mois de juin, un ingénieur logiciel senior de Deloitte US a indiqué que la modification du mode de tarification de GitHub avait modifié les attentes en matière de travail, les développeurs atteignant rapidement les nouveaux plafonds mensuels fixés. En septembre, OpenAI a indiqué que ses utilisateurs les plus intensifs d'agents de codage consommaient plus de 7 000 dollars de tokens par jour.
Passerelle, disjoncteurs et cache pour lisser la consommation
Chez McKinsey, une passerelle interne optimise les requêtes avant qu'elles n'atteignent les fournisseurs de modèles. Des disjoncteurs peuvent suspendre temporairement l'accès en cas de consommation particulièrement élevée de tokens, le temps d'évaluer si l'usage est productif. Le caching permet de réutiliser des réponses à des questions répétées et de mutualiser les coûts à l'échelle de l'entreprise plutôt que de les immobiliser dans des licences individuelles. Patnaik estime que l'usage pourrait devenir plus marqué dans six mois, mais précise que des contrôles complémentaires sont déjà en place.
Gouvernance centrée sur l'autonomie et premiers effets
Les alertes envoyées aux collaborateurs ne visent pas à limiter l'usage de l'IA, mais à rendre visible la consommation et à aider à accomplir les mêmes tâches de façon plus efficace. Patnaik affirme que l'autonomie des consultants reste un principe et que la formation à l'utilisation des outils a été essentielle pour piloter la consommation. Selon lui, l'entreprise a déjà constaté des changements dans les pratiques depuis que les employés disposent de plus de visibilité. Il indique également que l'usage interne n'a pas encore atteint un niveau problématique et que, pour les usages liés à la productivité personnelle ou à l'accélération des livrables, le rapport coût-bénéfice reste favorable.
Suivi individuel, déploiement estival et forte concentration des volumes
McKinsey effectue un suivi de la consommation de tokens pour chaque utilisateur et envoie des notifications par email en cas de dépassement, ce dispositif ayant été généralisé durant la période estivale. D'après un billet de blog de la société, près de 10 % des utilisateurs réalisent environ 65 % des volumes, les consultants et ingénieurs figurant parmi les principaux utilisateurs, et l'entreprise prévoyait de traiter environ cinq trillions de tokens par mois d'ici mai 2026. Patnaik inscrit cette approche dans une logique de transparence et de sensibilisation. Plus largement, l'entreprise a adopté des contrôles internes pour gérer l'usage, en privilégiant l'information plutôt que la restriction.
Tarification à la consommation et conseils : viser le coût par résultat
La fin des abonnements forfaitaires au profit d'une facturation à la consommation plus tôt cette année oblige les entreprises à surveiller le nombre de tokens utilisés. McKinsey a mis en place ce printemps une pratique formelle pour accompagner ses clients vers des déploiements rentables. Patnaik recommande d'évaluer le coût des tokens par résultat plutôt que par employé et met en garde contre une optimisation qui viserait uniquement à réduire les tokens, au risque de freiner des usages à valeur. Il souligne aussi qu'une baisse de coûts sur un poste peut en générer ailleurs, et rapporte que, sur le dernier trimestre, des clients ont pris conscience de coûts cachés à arbitrer face aux bénéfices compétitifs attendus. Pour l'instant, il estime qu'il reste pertinent d'encourager l'adoption. Son rôle porte principalement sur l'apport de capacités d'IA aux clients, tandis que McKinsey conseille déjà de grandes entreprises sur la maîtrise budgétaire. Les cabinets de conseil ont, pour leur part, largement introduit l'IA et affrontent désormais les coûts associés. Patnaik compare l'approche à l'information sur la consommation de données mobiles sur un téléphone professionnel. Il dirige QuantumBlack au Royaume-Uni.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.