# I team di agenti AI costano di più, ma raramente migliorano i risultati

> Uno studio di Vals AI mostra che i sistemi multi-agente possono consumare fino a cinque volte più token di un singolo modello, con miglioramenti minimi nella qualità.

Oossa · 2026-10-11 · https://oossa.com/it/ai-agent-teams-cost-more-but-rarely-improve-results

Data dell’evento: 2026-10-11

Una nuova valutazione di Vals AI ha confrontato agenti AI singoli e team di agenti sul suo Vibe Code Bench. Il test ha utilizzato due modelli di punta, GPT‑6 Sol e Claude Opus 5.5, sia da soli sia in gruppi fino a 100 agenti. I team hanno consumato da 1,8 × a 5,1 × più token rispetto a un singolo modello, ma hanno ottenuto punteggi quasi identici.

## Cosa mostrano i dati

Su quattro confronti diretti, solo uno ha raggiunto la significatività statistica: GPT‑6 Sol, con un livello di ragionamento medio, ha ottenuto un punteggio superiore di 7,3 punti quando è stato eseguito in team. Con l’impostazione di ragionamento massima, nessuno dei due modelli ha registrato un vantaggio misurabile. I dati suggeriscono che il maggiore costo computazionale degli sciami di agenti raramente si traduce in una qualità superiore, soprattutto quando i modelli funzionano già al massimo delle loro capacità.

## Perché più velocità non significa risultati migliori

Anche i ricercatori di OpenAI sono giunti a conclusioni simili. In un podcast, Noam Brown ha osservato che aggiungere agenti serve soprattutto ad accelerare le attività facilmente parallelizzabili, come la ricerca sul web o i calcoli matematici, ma non migliora la risposta in sé. Quattro agenti hanno risolto un compito in metà tempo, ma a un costo doppio. Passando a decine di agenti, i benefici si sono ridotti; per attività creative come scrivere un romanzo, gli sciami più numerosi non aggiungono alcun valore.

## I fatti

- Vals AI ha testato GPT‑6 Sol e Claude Opus 5.5 sul Vibe Code Bench l'11 ottobre 2026.
- I team hanno utilizzato da 1,8 × a 5,1 × più token rispetto agli agenti singoli.
- Solo uno dei quattro confronti ha mostrato un miglioramento significativo: GPT‑6 Sol con ragionamento medio, +7,3 punti.
- Con il ragionamento al massimo, i team non hanno offerto un vantaggio concreto per nessuno dei due modelli.
- Noam Brown di OpenAI ha affermato che quattro agenti hanno risolto i compiti in metà tempo, ma a un costo doppio.

## Perché conta

Per gli sviluppatori che pianificano il budget per le risorse di calcolo in cloud, lo studio avverte che aggiungere molti agenti AI probabilmente farà aumentare i costi senza migliorare la qualità del prodotto. Le aziende che intendono accelerare le attività di routine dovrebbero valutare il costo in token rispetto ai modesti guadagni di velocità e potrebbero ottenere risultati migliori ottimizzando i prompt per un singolo agente.

## Fonti e riferimenti

1. [AI agent teams waste massive tokens for barely measurable quality gains, research finds](https://the-decoder.com/ai-agent-teams-waste-massive-tokens-for-barely-measurable-quality-gains-research-finds/) – The Decoder, 2026-10-11

Ultimo aggiornamento: 2026-10-11
