Des essais menés par Vals AI, Anthropic et des membres d’OpenAI convergent vers le même constat : les équipes d’agents coûtent nettement plus cher et améliorent peu les résultats. Une seule configuration testée par Vals AI affiche un gain significatif de 7,3 points, quand la plupart n’en montrent aucun. Les gains de vitesse existent, mais ils s’accompagnent d’une facture en jetons et d’une « taxe de coordination » évoquée chez OpenAI.
OpenAI : des gains de temps proportionnels au coût
Noam Brown, chercheur chez OpenAI, indique que les systèmes multi-agents permettent principalement d'accélérer l'exécution des tâches, sans amélioration notable de la qualité. Il précise que quatre agents accomplissent une tâche deux fois plus vite, mais pour un coût également doublé, et qu'à 16 agents, cette tendance se poursuit avec une efficacité légèrement réduite. Brown souligne que l'utilisation de très grands groupes d'agents reste peu étudiée en raison de coûts trop élevés. Eric Provencher, développeur chez OpenAI, met en garde contre l'emploi massif d'agents, estimant que la coordination se détériore et que cela représente une « taxe de coordination » susceptible de rendre l'opération peu rentable.
Les benchmarks de Vals AI : un surcoût de 1,8x à 5,1x pour peu de gains
Vals AI a évalué GPT-6 Sol et Claude Opus 5.5 sur le Vibe Code Bench, en configurations individuelles et en équipes, à deux niveaux de raisonnement : moyen et maximal. Les équipes d'agents ont coûté entre 1,8 et 5,1 fois plus cher que les agents seuls. Sur quatre comparaisons, une seule a montré une amélioration statistiquement significative : l'équipe de GPT-6 Sol en raisonnement moyen, avec un gain de 7,3 points. Pour le niveau de raisonnement maximal, aucun avantage concret n'a été observé pour Sol ou Opus 5.5 lorsqu'ils étaient regroupés en équipe. Selon Vals AI, le coût supplémentaire lié aux équipes d'agents ne se justifie pas dans la plupart des cas, en particulier lorsque les modèles atteignent déjà leur capacité maximale. Le graphique du benchmark met en relation le coût par application et le score obtenu, montrant que les équipes entraînent une hausse marquée des coûts pour des améliorations de score très limitées.
Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic : gains de vitesse, rendements décroissants et dépendance à la tâche
Anthropic a constaté que les gains de qualité diminuent à mesure que le nombre d'agents augmente lors de tests avec Opus 5.5. Des équipes plus nombreuses atteignent plus rapidement un niveau de performance donné, mais passer de dix à cent agents n'a que légèrement augmenté les scores après 24 heures. Dans des essais séparés sur ProgramBench, l'accélération s'est accompagnée d'une hausse de la consommation de jetons. Noam Brown précise que l'effet des équipes dépend fortement de la tâche : la recherche web et les mathématiques se prêtent bien à la parallélisation, tandis que la rédaction d'un roman ne s'y adapte pas. Il illustre ce point en expliquant que lancer 10 000 agents sur un roman serait aussi inefficace que d'y affecter 10 000 personnes.






