# Google lanceert Android Bench 2.0 met langdurige taken en nieuwe scores

> De vernieuwde benchmark voegt ontwikkelingstaken van meerdere dagen, evaluatie van agents en een scoresysteem met gradaties toe om AI-assistenten voor Android-programmering te beoordelen.

Oossa · 2026-10-09 · https://oossa.com/nl/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google heeft Android Bench 2.0 uitgebracht, een upgrade van zijn benchmark voor Android-ontwikkeling door AI-modellen. De nieuwe versie bevat langdurige taken die een engineer dagen of een week kunnen kosten, en beoordeelt agents in plaats van alleen codefragmenten. De scores zijn nu doorlopend: functionaliteit, visuele gelijkenis en het opvolgen van instructies worden beoordeeld in plaats van alleen geslaagd of gezakt. Op het dashboard staat Claude Opus 5.5 bovenaan, met een slagingspercentage van 32% voor de moeilijkste taken.

## De feiten

- Android Bench 2.0 aangekondigd op 2026-10-09 ("Fri Oct 09 2026 19:00:00 GMT+0200").
- Claude Opus 5.5 eindigde bovenaan in het LHT-klassement met een slagingspercentage van 32%.

## Waarom het ertoe doet

Ontwikkelaars kunnen de benchmark gebruiken om te zien welke AI-assistenten het betrouwbaarst zijn voor complexe Android-projecten.

## Bronnen en referenties

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Laatst bijgewerkt: 2026-10-09
