Google heeft Android Bench 2.0 uitgebracht, een upgrade van zijn benchmark voor Android-ontwikkeling door AI-modellen. De nieuwe versie bevat langdurige taken die een engineer dagen of een week kunnen kosten, en beoordeelt agents in plaats van alleen codefragmenten. De scores zijn nu doorlopend: functionaliteit, visuele gelijkenis en het opvolgen van instructies worden beoordeeld in plaats van alleen geslaagd of gezakt. Op het dashboard staat Claude Opus 5.5 bovenaan, met een slagingspercentage van 32% voor de moeilijkste taken.
Waarom het ertoe doet
Ontwikkelaars kunnen de benchmark gebruiken om te zien welke AI-assistenten het betrouwbaarst zijn voor complexe Android-projecten.