I en ny utvärdering jämförde Vals AI enskilda AI-agenter med team av agenter i sitt Vibe Code Bench. Testet omfattade två ledande modeller – GPT‑6 Sol och Claude Opus 5.5 – både var för sig och i grupper med upp till 100 agenter. Teamen förbrukade mellan 1.8 × och 5.1 × fler token än en ensam modell, men fick nästan inte alls bättre poäng.
Vad siffrorna visar
Av fyra direkta jämförelser var bara en statistiskt signifikant: GPT‑6 Sol med medelhög resonemangsnivå fick 7.3 poäng mer när den kördes som ett team. Vid den högsta resonemangsnivån hade ingen av modellerna någon mätbar fördel. Resultaten tyder på att den extra beräkningskostnaden för agentflockar sällan leder till högre kvalitet, särskilt när modellerna redan körs med full kapacitet.
Varför snabbare inte betyder bättre resultat
Forskare på OpenAI gör samma bedömning. I en podd noterade Noam Brown att fler agenter främst snabbar upp uppgifter som lämpar sig för parallellisering, till exempel webbresearch eller matematik, men inte förbättrar själva svaret. Fyra agenter löste en uppgift dubbelt så snabbt, men kostade också dubbelt så mycket. När antalet ökade till dussintals agenter avtog vinsterna, och för kreativt arbete som att skriva romaner tillför stora agentgrupper inget värde.
Varför det spelar roll
För utvecklare som budgeterar för molnberäkning är studiens varning att fler AI-agenter sannolikt ökar kostnaderna utan att förbättra produktens kvalitet. Företag som planerar att snabba upp rutinuppgifter bör väga tokenkostnaden mot de begränsade tidsvinsterna och kan ha större nytta av att optimera promptar för en enda agent.