Oossa

I team di agenti AI costano di più, ma raramente migliorano i risultati

Uno studio di Vals AI mostra che i sistemi multi-agente possono consumare fino a cinque volte più token di un singolo modello, con miglioramenti minimi nella qualità.

Di Pubblicato da Oossa: 1 min di lettura

Data dell’evento:

Marvin Meyer · Unsplash

Una nuova valutazione di Vals AI ha confrontato agenti AI singoli e team di agenti sul suo Vibe Code Bench. Il test ha utilizzato due modelli di punta, GPT‑6 Sol e Claude Opus 5.5, sia da soli sia in gruppi fino a 100 agenti. I team hanno consumato da 1,8 × a 5,1 × più token rispetto a un singolo modello, ma hanno ottenuto punteggi quasi identici.

Cosa mostrano i dati

Su quattro confronti diretti, solo uno ha raggiunto la significatività statistica: GPT‑6 Sol, con un livello di ragionamento medio, ha ottenuto un punteggio superiore di 7,3 punti quando è stato eseguito in team. Con l’impostazione di ragionamento massima, nessuno dei due modelli ha registrato un vantaggio misurabile. I dati suggeriscono che il maggiore costo computazionale degli sciami di agenti raramente si traduce in una qualità superiore, soprattutto quando i modelli funzionano già al massimo delle loro capacità.

Perché più velocità non significa risultati migliori

Anche i ricercatori di OpenAI sono giunti a conclusioni simili. In un podcast, Noam Brown ha osservato che aggiungere agenti serve soprattutto ad accelerare le attività facilmente parallelizzabili, come la ricerca sul web o i calcoli matematici, ma non migliora la risposta in sé. Quattro agenti hanno risolto un compito in metà tempo, ma a un costo doppio. Passando a decine di agenti, i benefici si sono ridotti; per attività creative come scrivere un romanzo, gli sciami più numerosi non aggiungono alcun valore.

Perché conta

Per gli sviluppatori che pianificano il budget per le risorse di calcolo in cloud, lo studio avverte che aggiungere molti agenti AI probabilmente farà aumentare i costi senza migliorare la qualità del prodotto. Le aziende che intendono accelerare le attività di routine dovrebbero valutare il costo in token rispetto ai modesti guadagni di velocità e potrebbero ottenere risultati migliori ottimizzando i prompt per un singolo agente.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.