Oossa

Google lanserar Android Bench 2.0 med längre uppgifter och ny poängsättning

Den uppdaterade testsviten innehåller utvecklingsuppgifter som sträcker sig över flera dagar, utvärdering av AI-agenter och ett graderat poängsystem för att mäta AI-assistenter som kodar för Android.

NotisAv Publicerad av Oossa: 1 min läsning

Google har släppt Android Bench 2.0, en uppdatering av företagets testsvit för AI-modeller som utvecklar för Android. Den nya versionen innehåller uppgifter med lång tidshorisont som kan ta en ingenjör flera dagar eller en vecka att slutföra. Den utvärderar också AI-agenter, inte bara kodsnuttar. Poängsättningen är nu graderad och bedömer funktionalitet, visuell överensstämmelse och hur väl instruktionerna följs, i stället för att bara ge godkänt eller underkänt. I instrumentpanelen ligger Claude Opus 5.5 i topp, med 32 % godkända resultat på de svåraste uppgifterna.

Varför det spelar roll

Utvecklare kan använda testsviten för att se vilka AI-assistenter som är mest tillförlitliga för komplexa Android-projekt.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.