Oossa

Google lanceert Android Bench 2.0 met langdurige taken en nieuwe scores

De vernieuwde benchmark voegt ontwikkelingstaken van meerdere dagen, evaluatie van agents en een scoresysteem met gradaties toe om AI-assistenten voor Android-programmering te beoordelen.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Google heeft Android Bench 2.0 uitgebracht, een upgrade van zijn benchmark voor Android-ontwikkeling door AI-modellen. De nieuwe versie bevat langdurige taken die een engineer dagen of een week kunnen kosten, en beoordeelt agents in plaats van alleen codefragmenten. De scores zijn nu doorlopend: functionaliteit, visuele gelijkenis en het opvolgen van instructies worden beoordeeld in plaats van alleen geslaagd of gezakt. Op het dashboard staat Claude Opus 5.5 bovenaan, met een slagingspercentage van 32% voor de moeilijkste taken.

Waarom het ertoe doet

Ontwikkelaars kunnen de benchmark gebruiken om te zien welke AI-assistenten het betrouwbaarst zijn voor complexe Android-projecten.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.