# Google lanserar Android Bench 2.0 med längre uppgifter och ny poängsättning

> Den uppdaterade testsviten innehåller utvecklingsuppgifter som sträcker sig över flera dagar, utvärdering av AI-agenter och ett graderat poängsystem för att mäta AI-assistenter som kodar för Android.

Oossa · 2026-10-09 · https://oossa.com/sv/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google har släppt Android Bench 2.0, en uppdatering av företagets testsvit för AI-modeller som utvecklar för Android. Den nya versionen innehåller uppgifter med lång tidshorisont som kan ta en ingenjör flera dagar eller en vecka att slutföra. Den utvärderar också AI-agenter, inte bara kodsnuttar. Poängsättningen är nu graderad och bedömer funktionalitet, visuell överensstämmelse och hur väl instruktionerna följs, i stället för att bara ge godkänt eller underkänt. I instrumentpanelen ligger Claude Opus 5.5 i topp, med 32 % godkända resultat på de svåraste uppgifterna.

## Fakta

- Android Bench 2.0 tillkännagavs 2026-10-09 ("Fri Oct 09 2026 19:00:00 GMT+0200").
- Claude Opus 5.5 toppade LHT-rankningen med 32 % godkända resultat.

## Varför det spelar roll

Utvecklare kan använda testsviten för att se vilka AI-assistenter som är mest tillförlitliga för komplexa Android-projekt.

## Källor och referenser

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Senast uppdaterad: 2026-10-09
