Google ha rilasciato Android Bench 2.0, un aggiornamento del benchmark per valutare i modelli AI nello sviluppo Android. La nuova versione introduce compiti a lungo orizzonte, che possono richiedere a un ingegnere diversi giorni o una settimana, e valuta gli agenti anziché limitarsi a esaminare frammenti di codice. Il punteggio ora è graduato e valuta funzionalità, fedeltà visiva e rispetto delle istruzioni, invece di assegnare semplicemente un esito positivo o negativo. La dashboard mostra Claude Opus 5.5 in testa, con un tasso di superamento del 32% nei compiti più difficili.
Perché conta
Gli sviluppatori possono usare il benchmark per capire quali assistenti AI sono più affidabili nei progetti Android complessi.