Google har släppt Android Bench 2.0, en uppdatering av företagets testsvit för AI-modeller som utvecklar för Android. Den nya versionen innehåller uppgifter med lång tidshorisont som kan ta en ingenjör flera dagar eller en vecka att slutföra. Den utvärderar också AI-agenter, inte bara kodsnuttar. Poängsättningen är nu graderad och bedömer funktionalitet, visuell överensstämmelse och hur väl instruktionerna följs, i stället för att bara ge godkänt eller underkänt. I instrumentpanelen ligger Claude Opus 5.5 i topp, med 32 % godkända resultat på de svåraste uppgifterna.
Varför det spelar roll
Utvecklare kan använda testsviten för att se vilka AI-assistenter som är mest tillförlitliga för komplexa Android-projekt.