Le multi-agents promet de faire travailler plusieurs modèles sur une même mission. Pourtant, les premiers résultats comparatifs de 2026 montrent surtout une hausse de la facture : les équipes testées coûtent entre 1,8 et 5,1 fois plus cher que les agents individuels, tandis qu’une seule configuration sur quatre améliore significativement le score. Vals AI mesure alors un gain de 7,3 points, mais dans un cas précis seulement.
Cette comparaison oppose deux architectures, un agent unique capable de planifier et d’exécuter une tâche, et une équipe d’agents spécialisés qui se répartissent le travail. Le critère décisif n’est plus le nombre d’agents mobilisés, mais l’adéquation entre la structure de la tâche, le coût de coordination et le niveau de qualité recherché.
Agent individuel ou équipe d’agents : deux architectures qui ne répondent pas au même problème
Un agent individuel regroupe dans une seule boucle le raisonnement, l’usage des outils, la mémoire de travail et la vérification. Il peut analyser une demande, appeler une API, modifier un fichier ou produire une réponse sans transmettre son contexte à un autre agent. Cette simplicité limite les échanges intermédiaires et facilite l’identification des erreurs.
Le système multi-agents répartit la mission entre plusieurs instances. Un agent peut planifier, un autre rechercher des informations, un troisième écrire du code et un quatrième vérifier le résultat. Cette organisation ressemble à une équipe, mais chaque transfert de contexte ajoute une étape susceptible d'introduire une erreur, une redondance ou une dépense supplémentaire.
La différence ne tient donc pas seulement au nombre de modèles. Elle concerne aussi le protocole de coordination : structure en étoile avec un agent central, chaîne de délégation, arbre de sous-tâches ou graphe d’échanges. MultiAgentBench, présenté dans la littérature de 2025, évalue notamment ces topologies en mesurant l’achèvement des tâches et la qualité de la collaboration.
| Critère | Agent individuel | Système multi-agents |
|---|---|---|
| Organisation | Une boucle de raisonnement et d’action | Plusieurs agents spécialisés et coordonnés |
| Coordination | Interne au même agent | Délégation, échanges et synthèse |
| Coût en jetons | Limité au contexte et aux outils utilisés | Augmente avec les messages et les sorties intermédiaires |
| Diagnostic des erreurs | Centralisé | Réparti entre les agents et les handoffs |
| Cas favorable | Tâche cohérente avec contexte partagé | Sous-tâches indépendantes et parallélisables |
Le multi-agents n’est donc pas une version automatiquement supérieure de l’agent individuel. Il s’agit d’un choix d’architecture, qui doit être justifié par la forme de la mission.
Le test de Vals AI : jusqu’à 5,1 fois plus cher pour une qualité presque inchangée
L’étude de Vals AI compare GPT-6 Sol et Claude Opus 5.5 sur le Vibe Code Bench. Les modèles sont évalués seuls puis en équipe, avec deux niveaux d’effort de raisonnement, moyen et maximal. Les quatre configurations équipe contre agent individuel permettent de mesurer l’effet de la collaboration à modèle et niveau d’effort comparables.
Le résultat économique est net : les équipes coûtent entre 1,8 et 5,1 fois plus cher que les agents individuels. La hausse provient des appels supplémentaires, des productions intermédiaires et des échanges nécessaires pour répartir puis recomposer la tâche.
Sur la qualité, une seule des quatre comparaisons affiche une amélioration statistiquement significative. GPT-6 Sol à effort moyen progresse de 77,6 % à 84,9 %, soit 7,3 points, avec une valeur de p de 0,005. Les trois autres écarts, compris entre une baisse de 0,3 point et une hausse de 3,4 points, ne sont pas statistiquement significatifs.
À retenir : l’équipe d’agents peut améliorer le résultat dans une configuration précise, mais le test de Vals AI ne montre pas de bénéfice régulier de la multiplication des agents.
Le contraste est particulièrement marqué à l’effort maximal. Lorsque l’agent individuel dispose déjà d’un budget de raisonnement important, l’équipe n’apporte pas d’avantage pertinent pour Sol ni pour Opus 5.5. Une partie du travail supplémentaire effectué par les agents semble alors répéter ou coordonner des opérations que le modèle principal peut déjà réaliser seul.
Pourquoi la vitesse augmente sans garantir une meilleure réponse
Le multi-agents peut réduire la durée d’exécution lorsqu’une mission contient plusieurs sous-tâches indépendantes. Des recherches parallèles, des analyses de fichiers distincts ou des vérifications séparées peuvent être lancées en même temps. La durée totale dépend alors davantage de la branche la plus lente que de la somme de toutes les opérations.
Cette accélération ne signifie pas que le système produit une meilleure réponse. Les agents doivent toujours communiquer leurs résultats, résoudre les contradictions et produire une synthèse finale. Si la coordination devient le goulot d’étranglement, le temps gagné sur les sous-tâches est partiellement absorbé par les échanges.
La consommation de jetons augmente également. Une analyse relayée par AlphaSignal, à partir des résultats de Vals AI, indique que les équipes dépensent davantage sans convertir systématiquement cette dépense en points de qualité. Une autre synthèse consacrée à l’évaluation des systèmes multi-agents rapporte qu’Anthropic estime les systèmes multi-agents à environ 15 fois le volume de jetons d’une conversation classique.
Ce ratio ne constitue pas un prix universel : la facture réelle dépend du modèle, de la longueur du contexte, du nombre d’agents, des outils et du protocole d’orchestration. Il donne cependant une indication sur le principal risque opérationnel, une architecture plus rapide peut être beaucoup plus coûteuse à chaque exécution.
Le coût de coordination devient une variable de premier ordre
Dans un agent individuel, le contexte reste généralement centralisé. Dans une équipe, chaque handoff doit transmettre les informations utiles au prochain agent. Le système peut alors recopier des instructions, des extraits de documents, des résultats intermédiaires et des consignes de vérification.
Cette duplication entraîne quatre effets :
- davantage de jetons en entrée et en sortie ;
- davantage d’appels au modèle ;
- davantage d’occasions de perdre une information importante ;
- davantage de résultats à vérifier avant la synthèse finale.
Une équipe peut donc être rapide sur le calendrier tout en étant inefficace sur le coût par tâche. Pour comparer correctement les architectures, il faut suivre au minimum la qualité finale, la latence, le nombre de jetons, le coût total et la fiabilité des résultats.
Les tâches parallélisables donnent un avantage réel au multi-agents
Le multi-agents devient pertinent lorsque le travail peut être découpé en blocs relativement autonomes. Chaque agent doit disposer d’un périmètre clair, d’outils adaptés et d’un résultat vérifiable. Plus les sous-tâches sont indépendantes, moins les échanges entre agents risquent de créer des incohérences.
Les cas les plus favorables sont notamment :
- comparer plusieurs documents ou sources en parallèle ;
- analyser séparément des modules logiciels ;
- effectuer plusieurs recherches spécialisées avant une synthèse ;
- générer plusieurs propositions puis les soumettre à un évaluateur ;
- exécuter des contrôles indépendants sur un même livrable.
Dans ces scénarios, la coordination peut prendre la forme d’un orchestrateur qui distribue les missions et collecte des résultats standardisés. La qualité dépend alors fortement de la précision des contrats de sortie : format attendu, critères d’acceptation, niveau de preuve et conditions d’échec.
La spécialisation ne suffit toutefois pas à justifier une équipe. Si les agents travaillent sur les mêmes informations, modifient les mêmes fichiers ou dépendent de décisions prises en temps réel, les échanges deviennent plus nombreux. La coordination peut alors annuler l’avantage du parallélisme.
Les agents individuels restent adaptés aux tâches à contexte partagé
Un agent unique conserve une vue cohérente de la demande, des décisions précédentes et des contraintes. Cette propriété est utile lorsque chaque étape dépend fortement de la précédente. Elle réduit aussi le risque qu’un agent secondaire interprète différemment un objectif ou oublie une contrainte transmise dans un message intermédiaire.
Les tâches de développement logiciel illustrent cette limite. Une modification dans un fichier peut affecter une interface, une base de données, des tests et une configuration. Séparer ces éléments entre agents impose des synchronisations fréquentes. Une équipe peut produire davantage de code, mais aussi multiplier les conflits et les corrections.
Une synthèse consacrée aux systèmes multi-agents rapporte d’ailleurs qu’Anthropic considère les tâches de programmation nécessitant un contexte partagé ou de nombreuses dépendances comme peu adaptées aux architectures multi-agents actuelles. Cette réserve rejoint les résultats de Vals AI : à effort de raisonnement maximal, le travail d’équipe n’apporte pas de gain pertinent face à l’agent individuel.
L’agent unique présente aussi un avantage de gouvernance. Son journal d’actions est plus facile à lire, ses appels d’outils sont plus simples à attribuer et son comportement peut être évalué avec moins de variables. En production, cette traçabilité réduit le temps nécessaire pour comprendre pourquoi une tâche a échoué.
Le nombre d’agents ne doit pas devenir un objectif en soi
Les rendements décroissent rapidement lorsque le nombre d’agents augmente. Le premier agent supplémentaire peut apporter une compétence ou une capacité de vérification utile. Le suivant peut surtout répéter une analyse déjà effectuée. À partir d’un certain seuil, les messages de coordination et les synthèses intermédiaires absorbent une part croissante du budget.
Cette dynamique explique pourquoi une équipe de deux ou trois agents ne doit pas être comparée de la même manière à une architecture de dix agents. Le nombre de chemins possibles augmente, les sorties deviennent plus difficiles à agréger et les erreurs de coordination se propagent plus facilement.
Les benchmarks multi-agents récents cherchent précisément à séparer la réussite finale de la qualité des interactions. MultiAgentBench mesure l’achèvement des tâches et la collaboration au moyen d’indicateurs liés à des étapes intermédiaires. Des outils d’évaluation recommandent également de suivre chaque handoff, pour vérifier que l’agent receveur reçoit le contexte nécessaire, choisit le bon outil et reste aligné sur l’objectif.
Une méthode de comparaison opérationnelle
Une entreprise qui hésite entre les deux architectures peut commencer par une version individuelle, puis ajouter une équipe uniquement si un échec récurrent est clairement attribué à un manque de parallélisme, de spécialisation ou de vérification.
Le protocole de comparaison doit conserver la même tâche, le même jeu de données et des critères identiques. Il doit mesurer :
- le taux de réussite final ;
- le coût par tâche ;
- le temps jusqu’au résultat ;
- le nombre de jetons consommés ;
- le nombre d’appels d’outils ;
- le taux d’échec des handoffs ;
- la stabilité du résultat sur plusieurs exécutions.
Une équipe ne devrait être retenue que si son amélioration dépasse son surcoût et reste stable sur des cas nouveaux. Un gain observé sur une seule démonstration ne suffit pas à établir un avantage de production.
Vitesse, qualité et coût : le véritable arbitrage de 2026
Le choix entre agent individuel et multi-agents dépend de la priorité opérationnelle. Si la latence est critique et que les sous-tâches sont indépendantes, une équipe peut réduire le temps de traitement. Si la qualité, la cohérence et la maîtrise du budget dominent, l’agent individuel constitue souvent le point de départ le plus robuste.
Le test de Vals AI fournit un repère chiffré pour cet arbitrage. Une équipe a gagné 7,3 points dans une configuration précise, mais les quatre configurations ont toutes payé un surcoût situé entre 1,8 et 5,1 fois. Le gain de qualité n’est donc ni automatique ni proportionnel au nombre d’agents.
Les organisations doivent aussi distinguer le coût de calcul du coût de supervision. Une architecture complexe exige davantage de journalisation, de tests, de gestion des erreurs et de contrôle des sorties. Même lorsque le prix des modèles baisse, le temps passé à maintenir les orchestrations peut rester significatif.
Les benchmarks de recherche intensive soulignent également le lien entre budget et qualité. Dans le benchmark ATLAS, les agents utilisant un effort de recherche maximal dépassent régulièrement ceux qui disposent de moins de calcul, tandis qu’aucune exécution coûtant moins d’un dollar par tâche n’atteint un score row F1 supérieur à 0,5. Ce résultat concerne les tâches de recherche évaluées par ATLAS, pas tous les usages d’agents, mais il rappelle qu’une baisse du coût peut entraîner une baisse de performance.
Notre avis : commencez par un agent, ajoutez une équipe seulement sur preuve
En 2026, l’agent individuel doit rester l’architecture par défaut. Il coûte moins cher, conserve mieux le contexte, simplifie l’observabilité et fournit une base plus facile à comparer. Le multi-agents mérite sa place lorsque la mission est naturellement parallèle, que chaque sous-tâche possède un résultat mesurable et que la vitesse justifie une dépense supérieure.
Les résultats de Vals AI rendent une règle de prudence difficile à écarter : payer jusqu’à 5,1 fois plus ne garantit pas une meilleure qualité. La configuration GPT-6 Sol à effort moyen montre qu’un gain de 7,3 points peut exister, mais les trois autres comparaisons ne produisent pas d’amélioration statistiquement significative.
La stratégie la plus solide consiste donc à augmenter progressivement la complexité : agent individuel, puis ajout d’un vérificateur ou d’un agent spécialisé, avant toute équipe plus large. Si le système multi-agents n’améliore pas simultanément la qualité, la latence ou la couverture fonctionnelle avec un coût acceptable, il ne s’agit pas d’une optimisation mais d’une dépense supplémentaire.
Dans six mois, la question ne sera probablement pas de savoir combien d’agents une plateforme peut lancer, mais combien elle peut coordonner sans dégrader la qualité et la rentabilité. Les architectures capables de prouver ce ratio auront-elles un avantage durable sur les systèmes qui se contentent d’ajouter des agents ?