Una nuova valutazione di Vals AI ha confrontato agenti AI singoli e team di agenti sul suo Vibe Code Bench. Il test ha utilizzato due modelli di punta, GPT‑6 Sol e Claude Opus 5.5, sia da soli sia in gruppi fino a 100 agenti. I team hanno consumato da 1,8 × a 5,1 × più token rispetto a un singolo modello, ma hanno ottenuto punteggi quasi identici.
Cosa mostrano i dati
Su quattro confronti diretti, solo uno ha raggiunto la significatività statistica: GPT‑6 Sol, con un livello di ragionamento medio, ha ottenuto un punteggio superiore di 7,3 punti quando è stato eseguito in team. Con l’impostazione di ragionamento massima, nessuno dei due modelli ha registrato un vantaggio misurabile. I dati suggeriscono che il maggiore costo computazionale degli sciami di agenti raramente si traduce in una qualità superiore, soprattutto quando i modelli funzionano già al massimo delle loro capacità.
Perché più velocità non significa risultati migliori
Anche i ricercatori di OpenAI sono giunti a conclusioni simili. In un podcast, Noam Brown ha osservato che aggiungere agenti serve soprattutto ad accelerare le attività facilmente parallelizzabili, come la ricerca sul web o i calcoli matematici, ma non migliora la risposta in sé. Quattro agenti hanno risolto un compito in metà tempo, ma a un costo doppio. Passando a decine di agenti, i benefici si sono ridotti; per attività creative come scrivere un romanzo, gli sciami più numerosi non aggiungono alcun valore.
Perché conta
Per gli sviluppatori che pianificano il budget per le risorse di calcolo in cloud, lo studio avverte che aggiungere molti agenti AI probabilmente farà aumentare i costi senza migliorare la qualità del prodotto. Le aziende che intendono accelerare le attività di routine dovrebbero valutare il costo in token rispetto ai modesti guadagni di velocità e potrebbero ottenere risultati migliori ottimizzando i prompt per un singolo agente.