Oossa

Google lancia Android Bench 2.0: compiti lunghi e nuovi punteggi

La nuova versione introduce attività di sviluppo che durano più giorni, valutazioni basate su agenti e un sistema di punteggio graduato per misurare le capacità degli assistenti AI nella programmazione Android.

BreveDi Pubblicato da Oossa: 1 min di lettura

Google ha rilasciato Android Bench 2.0, un aggiornamento del benchmark per valutare i modelli AI nello sviluppo Android. La nuova versione introduce compiti a lungo orizzonte, che possono richiedere a un ingegnere diversi giorni o una settimana, e valuta gli agenti anziché limitarsi a esaminare frammenti di codice. Il punteggio ora è graduato e valuta funzionalità, fedeltà visiva e rispetto delle istruzioni, invece di assegnare semplicemente un esito positivo o negativo. La dashboard mostra Claude Opus 5.5 in testa, con un tasso di superamento del 32% nei compiti più difficili.

Perché conta

Gli sviluppatori possono usare il benchmark per capire quali assistenti AI sono più affidabili nei progetti Android complessi.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.