Les équipes multi-agents n'ont pas produit de gains de qualité à la hauteur de leur coût. Le 11 octobre 2026, la société d'évaluation Vals AI a publié sur son benchmark de programmation Vibe Code Bench une comparaison directe entre mode solo et mode équipe : GPT-6 Sol et Claude Opus 5.5 ont accompli les mêmes tâches seuls, puis en équipe. Les équipes ont coûté de 1,8 à 5,1 fois plus cher qu'un agent seul, et sur quatre comparaisons, une seule a montré une amélioration de qualité statistiquement significative.
Ce qui a été comparé, précisément
Vibe Code Bench demande aux modèles de construire des applications fonctionnelles à partir d'un brief, puis note leur degré d'achèvement. Vals AI a fait tourner les deux modèles à deux niveaux de raisonnement, moyen et maximal, en comparant à chaque niveau un agent seul face à une équipe. Le seul résultat significatif vient de GPT-6 Sol en raisonnement moyen, où l'équipe a marqué 7,3 points de plus. En raisonnement maximal, le mode équipe n'a montré aucun avantage mesurable pour l'un ou l'autre modèle. Au niveau le plus élevé, faire réfléchir un seul modèle plus longtemps et ajouter des renforts produisent des effets qui se recouvrent largement, alors que les factures varient du simple au multiple.
De 1 à 100 agents, la courbe s'aplatit vite
Anthropic a mené une expérience d'échelle comparable pour le rapport système de Claude Opus 5.5, en faisant passer le nombre d'agents sur une tâche de 1 à 100. La courbe monte fort, puis s'aplatit :
| Tâche | 1 agent | 10 | 30 | 100 |
|---|---|---|---|---|
| Base de connaissances | 0,53 | 0,70 | 0,71 | 0,74 |
| Preuves de théorèmes Lean | 0,39 | 0,66 | 0,66 | 0,68 |
Passer de 1 à 10 agents a aidé de façon visible. Passer de 10 à 100 n'a fait bouger chaque score que de quelques centièmes. Claude Fable 5.1 a davantage profité de l'échelle sur les preuves de théorèmes, tout en restant derrière Opus 5.5 au total, et son score en base de connaissances a même légèrement reculé entre 30 et 100 agents. L'avantage le plus fiable d'une grande équipe était d'atteindre le même niveau plus vite, pas un niveau supérieur, et dans les tests ProgramBench d'Anthropic, cette vitesse s'accompagnait aussi d'une consommation de tokens plus élevée.
Ce que les équipes achètent vraiment, c'est du temps
Le chercheur d'OpenAI Noam Brown a proposé dans un podcast une explication cohérente avec les deux séries de données : les configurations multi-agents achètent surtout de la vitesse, pas la qualité des réponses. Quatre agents terminaient les tâches environ deux fois plus vite, pour environ deux fois le coût. Les tâches décomposables en morceaux parallèles, comme la recherche web et les mathématiques, en profitent le plus ; celles qui ne se parallélisent pas, comme l'écriture d'un roman, ne gagnent rien à la foule. Le développeur Codex d'OpenAI Eric Provencher parle à ce sujet d'une taxe de coordination : les agents ne font pas entièrement confiance au travail des autres, ils revérifient et répètent les appels d'outils, et la vérification elle-même consomme des tokens.
Les équipes qui paient des agents devraient d'abord faire leurs propres comptes
Trois enseignements en découlent pour les équipes qui achètent et déploient des agents. Le travail en équipe a du sens quand une tâche se découpe en blocs parallèles indépendants et que le délai de livraison vaut lui-même de l'argent. Quand la tâche suit une seule chaîne de raisonnement, ou que le modèle tourne déjà au maximum de raisonnement, augmenter le budget de raisonnement rapporte en général davantage que d'ajouter des effectifs. Et avant tout déploiement, il faut comparer solo et équipe sur ses propres tâches réelles, en suivant le coût par livrable plutôt que le seul total de tokens. L'industrie fait de l'orchestration à grande échelle un argument de vente, avec par exemple Claude Managed Agents, capables de coordonner jusqu'à 1000 agents en une seule exécution, mais l'orchestration répond à la question de savoir si les agents peuvent travailler en même temps. Savoir s'ils le devraient dépend toujours du degré de parallélisme réel de la tâche.