# Les équipes d’agents IA coûtent plus cher, sans meilleurs résultats

> Selon une étude de Vals AI, les configurations multi-agents peuvent consommer jusqu’à cinq fois plus de tokens qu’un modèle seul pour des gains de qualité minimes.

Oossa · 2026-10-11 · https://oossa.com/fr/ai-agent-teams-cost-more-but-rarely-improve-results

Date de l’événement: 2026-10-11

Une nouvelle évaluation de Vals AI a comparé des agents d’IA individuels à des équipes d’agents sur son Vibe Code Bench. Le test a porté sur deux modèles de pointe — GPT‑6 Sol et Claude Opus 5.5 — utilisés seuls ou en groupes allant jusqu’à 100 agents. Les équipes ont consommé entre 1.8 × et 5.1 × plus de tokens qu’un modèle seul, sans pour autant obtenir de meilleurs scores de façon notable.

## Ce que montrent les chiffres

Sur quatre comparaisons directes, une seule a révélé un écart statistiquement significatif : GPT‑6 Sol a obtenu 7.3 points de plus en équipe avec un niveau de raisonnement moyen. Au niveau de raisonnement maximal, aucun des deux modèles n’a enregistré de gain mesurable. Les données indiquent que le surcoût de calcul des essaims d’agents se traduit rarement par une meilleure qualité, surtout lorsque les modèles fonctionnent déjà à pleine capacité.

## Pourquoi aller plus vite ne garantit pas un meilleur résultat

Des chercheurs d’OpenAI font écho à ces conclusions. Dans un podcast, Noam Brown a indiqué que l’ajout d’agents accélère surtout les tâches qui se prêtent bien au traitement en parallèle, comme la recherche sur le web ou les mathématiques, mais n’améliore pas la réponse elle-même. Quatre agents ont résolu une tâche deux fois plus vite, mais ont aussi coûté deux fois plus cher. Le passage à des dizaines d’agents a montré des rendements décroissants et, pour les travaux créatifs comme l’écriture d’un roman, les grands essaims n’apportent rien.

## Les faits

- Vals AI a testé GPT‑6 Sol et Claude Opus 5.5 sur le Vibe Code Bench le Oct 11 2026.
- Les configurations en équipe ont utilisé 1.8 × à 5.1 × plus de tokens que les agents seuls.
- Une seule des quatre comparaisons a montré un gain significatif : +7.3 points pour GPT‑6 Sol avec un niveau de raisonnement moyen.
- Au niveau de raisonnement maximal, les équipes n’ont apporté aucun avantage réel pour l’un ou l’autre modèle.
- Noam Brown, d’OpenAI, a déclaré que quatre agents résolvaient les tâches deux fois plus vite, mais à un coût doublé.

## Pourquoi c'est important

Pour les développeurs qui budgétisent leurs dépenses de calcul dans le cloud, cette étude met en garde contre le recours à de nombreux agents d’IA, qui risque d’augmenter les coûts sans améliorer la qualité du produit. Les entreprises qui cherchent à accélérer des tâches courantes devraient comparer le coût en tokens aux gains de vitesse modestes ; elles auraient peut-être intérêt à optimiser les consignes données à un agent unique.

## Sources et références

1. [AI agent teams waste massive tokens for barely measurable quality gains, research finds](https://the-decoder.com/ai-agent-teams-waste-massive-tokens-for-barely-measurable-quality-gains-research-finds/) – The Decoder, 2026-10-11

Dernière mise à jour: 2026-10-11
