Brief IA : Agents d’IA : trois motifs qui font flamber la facture

Agents d’IA : trois motifs qui font flamber la facture

Brief IA
Tom Levy·4 min·2 vues

Les agents d'IA consomment environ quatre fois plus de tokens qu'une session de chat, et les configurations multi-agents en consomment jusqu'à quinze fois plus, selon Anthropic. Une étude de l'UC Berkeley a identifié qu'une seule requête peut entraîner plus de mille appels de feuilles en raison de la récursion, tandis que des modes d'échec comme la répétition et l'incapacité à s'arrêter sont parmi les plus fréquents. Ces dérives échappent aux métriques classiques, rendant nécessaire l'utilisation de compteurs orientés objectif pour contenir les coûts.

En bref
1Selon Anthropic, les agents consomment environ 4 fois plus de tokens qu’un chat, et les configurations multi-agents environ 15 fois
2UC Berkeley a analysé plus de 1 600 traces et recensé 14 modes d’échec, dont la répétition parmi les plus courants
3Trois motifs dominent : boucles, dérive, récursion ; un suivi centré sur l’objectif aide à les détecter
💡Pourquoi c'est importantces dérapages ne génèrent pas d’erreurs visibles et échappent aux métriques classiques, d’où la nécessité d’instrumenter des compteurs orientés objectif pour contenir les coûts.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Certaines boucles d’agents d’IA se déroulent sans le moindre code 500, avec des métriques vertes et une addition salée à la fin. Des données de production et une étude académique décrivent des comportements coûteux qui échappent aux compteurs traditionnels. Trois motifs dominent ces dérives, et quelques métriques centrées sur l’objectif suffisent à les repérer.

Coûts démultipliés et fréquence documentée

D’après Anthropic, les agents utilisent en production près de quatre fois plus de tokens qu’une session de chat, et les systèmes multi-agents en consomment environ quinze fois plus. La récursion met en évidence l’augmentation rapide des coûts : avec une profondeur de cinq et un facteur de branchement de quatre, une seule requête peut aboutir à plus de mille appels de feuilles. Cette courbe est la plus défavorable car elle multiplie les opérations, mais une limite stricte sur la profondeur permet d’y mettre fin. Côté fréquence, une équipe de l’UC Berkeley a construit MAST, une taxonomie issue de plus de 1 600 traces couvrant sept frameworks : deux des quatorze modes d’échec concernent la répétition et l’incapacité à s’arrêter, et cette répétition figure parmi les échecs les plus courants.

Surveiller l’objectif plutôt que la requête

Le périmètre de la surveillance doit se déplacer de la requête vers l’objectif poursuivi. Compter les étapes de raisonnement, les appels d’outils, les tokens consommés par session et la répétition d’un même mouvement signale des dérives qu’un suivi par requête ne voit pas. Un seul objectif peut déclencher des centaines d’appels de modèles, dont chacun peut réussir alors que la session n’avance pas, et chaque élément rapportant son succès rend l’ensemble invisible. Une limite de taux par appel ne voit pas qu’un objectif en a déclenché neuf cents, et un contrôle de santé valide un service qui peut pourtant boucler indéfiniment, tandis que l’argent circule plus vite que dans les systèmes habituels. Quatre métriques issues des traces standard font l’essentiel, dont le taux de consommation de tokens par session, mesuré comme un total sur la durée de la session ou par étapes complétées.

Signatures des boucles, dérives et récursions

Trois motifs concentrent la plupart des dépenses incontrôlées et laissent chacun une signature repérable. Les boucles se voient dans les traces comme des appels frères au même outil avec des arguments quasi identiques, chacun correct mais sans ajout d’information ; leur détection relève de la comparaison, par exemple en hachant le nom d’outil et ses arguments normalisés, puis en comptant les répétitions consécutives : trois peuvent être une nouvelle tentative, dix constituent une boucle, et ce cas n’est pas rare. La dérive correspond à un éloignement progressif de la tâche sans faute manifeste : elle produit un travail plausible, bien formé et facturable, mais non demandé ; on la suit en intégrant l’objectif initial et chaque sortie, puis en observant la distance sémantique au fil de la session, une courbe ascendante indiquant la dérive. La récursion survient quand un agent engendre des sous-agents en cascade, par exemple en divisant un objectif en quatre, puis à nouveau en quatre, des décisions localement raisonnables mais qui s’accumulent sans plafond de profondeur.

Pourquoi les métriques classiques passent à côté

La télémétrie historique se concentre sur la disponibilité, la latence et le taux d’erreur, dans un modèle où une requête entraîne une réponse et où le coût se lit à l’aune des serveurs loués. Les agents brisent ces hypothèses : un objectif entre, un nombre d’étapes inconnu sort, avec maintien d’état, appels d’outils et une décision interne sur l’effort avant l’arrêt, pour un comportement qui n’existe qu’à l’exécution. Dans cette classe d’échecs, tout fonctionne mais l’absence de progrès est l’indicateur pertinent, et elle se perd sous des appels tous réussis.

Un cas type : tout est vert, sauf la facture

Un scénario observé consiste en un agent qui dépense en un week-end l’équivalent d’un mois de budget alors que tout paraît nominal : chaque requête renvoie 200, la latence reste dans le SLO, le CPU est stable et les graphiques de surveillance sont au vert. Rien ne bouge, sauf la facture, qui grimpe de quelques dollars par jour à plusieurs centaines de dollars en deux nuits. La trace révèle des milliers d’appels au même outil avec des arguments presque identiques, tous corrects, sans que l’agent décide jamais d’avoir terminé.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires