In een nieuwe evaluatie vergeleek Vals AI één AI-agent met teams van agenten op zijn Vibe Code Bench. De test gebruikte twee toonaangevende modellen – GPT‑6 Sol en Claude Opus 5.5 – afzonderlijk en in groepen van maximaal 100 agenten. De teams verbruikten 1.8 × tot 5.1 × zoveel tokens als één model, maar behaalden vrijwel geen hogere scores.
Wat de cijfers laten zien
Van de vier rechtstreekse vergelijkingen was er maar één statistisch significant: GPT‑6 Sol scoorde bij een gemiddeld redeneerniveau 7.3 punten hoger als team. Bij de hoogste redeneerinstelling boekte geen van beide modellen een meetbaar voordeel. De gegevens wijzen erop dat de extra rekenkosten van zwermen agenten zelden tot betere kwaliteit leiden, vooral wanneer de modellen al op volle capaciteit draaien.
Sneller betekent niet beter
Onderzoekers van OpenAI komen tot een vergelijkbare conclusie. Noam Brown merkte in een podcast op dat extra agenten vooral taken versnellen die goed parallel uit te voeren zijn, zoals webonderzoek of rekenen, maar het antwoord zelf niet verbeteren. Vier agenten losten een taak twee keer zo snel op, maar kostten ook twee keer zoveel. Bij opschaling naar tientallen agenten nam de meeropbrengst af; voor creatief werk, zoals het schrijven van een roman, voegen grote zwermen niets toe.
Waarom het ertoe doet
Voor ontwikkelaars die hun cloudrekenkracht budgetteren, is de waarschuwing van het onderzoek dat extra AI-agenten de kosten waarschijnlijk opdrijven zonder de kwaliteit van het product te verbeteren. Bedrijven die routinetaken willen versnellen, moeten de tokenkosten afwegen tegen de beperkte tijdwinst en zijn mogelijk beter af met het optimaliseren van prompts voor één agent.