# Google lancia Android Bench 2.0: compiti lunghi e nuovi punteggi

> La nuova versione introduce attività di sviluppo che durano più giorni, valutazioni basate su agenti e un sistema di punteggio graduato per misurare le capacità degli assistenti AI nella programmazione Android.

Oossa · 2026-10-09 · https://oossa.com/it/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google ha rilasciato Android Bench 2.0, un aggiornamento del benchmark per valutare i modelli AI nello sviluppo Android. La nuova versione introduce compiti a lungo orizzonte, che possono richiedere a un ingegnere diversi giorni o una settimana, e valuta gli agenti anziché limitarsi a esaminare frammenti di codice. Il punteggio ora è graduato e valuta funzionalità, fedeltà visiva e rispetto delle istruzioni, invece di assegnare semplicemente un esito positivo o negativo. La dashboard mostra Claude Opus 5.5 in testa, con un tasso di superamento del 32% nei compiti più difficili.

## I fatti

- Android Bench 2.0 annunciato il 2026-10-09 ("Fri Oct 09 2026 19:00:00 GMT+0200").
- Claude Opus 5.5 è in testa alla classifica LHT con un tasso di superamento del 32%.

## Perché conta

Gli sviluppatori possono usare il benchmark per capire quali assistenti AI sono più affidabili nei progetti Android complessi.

## Fonti e riferimenti

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Ultimo aggiornamento: 2026-10-09
