Une nouvelle évaluation de Vals AI a comparé des agents d’IA individuels à des équipes d’agents sur son Vibe Code Bench. Le test a porté sur deux modèles de pointe — GPT‑6 Sol et Claude Opus 5.5 — utilisés seuls ou en groupes allant jusqu’à 100 agents. Les équipes ont consommé entre 1.8 × et 5.1 × plus de tokens qu’un modèle seul, sans pour autant obtenir de meilleurs scores de façon notable.
Ce que montrent les chiffres
Sur quatre comparaisons directes, une seule a révélé un écart statistiquement significatif : GPT‑6 Sol a obtenu 7.3 points de plus en équipe avec un niveau de raisonnement moyen. Au niveau de raisonnement maximal, aucun des deux modèles n’a enregistré de gain mesurable. Les données indiquent que le surcoût de calcul des essaims d’agents se traduit rarement par une meilleure qualité, surtout lorsque les modèles fonctionnent déjà à pleine capacité.
Pourquoi aller plus vite ne garantit pas un meilleur résultat
Des chercheurs d’OpenAI font écho à ces conclusions. Dans un podcast, Noam Brown a indiqué que l’ajout d’agents accélère surtout les tâches qui se prêtent bien au traitement en parallèle, comme la recherche sur le web ou les mathématiques, mais n’améliore pas la réponse elle-même. Quatre agents ont résolu une tâche deux fois plus vite, mais ont aussi coûté deux fois plus cher. Le passage à des dizaines d’agents a montré des rendements décroissants et, pour les travaux créatifs comme l’écriture d’un roman, les grands essaims n’apportent rien.
Pourquoi c'est important
Pour les développeurs qui budgétisent leurs dépenses de calcul dans le cloud, cette étude met en garde contre le recours à de nombreux agents d’IA, qui risque d’augmenter les coûts sans améliorer la qualité du produit. Les entreprises qui cherchent à accélérer des tâches courantes devraient comparer le coût en tokens aux gains de vitesse modestes ; elles auraient peut-être intérêt à optimiser les consignes données à un agent unique.