# Google stellt Android Bench 2.0 mit Langzeitaufgaben vor

> Der aktualisierte Benchmark umfasst mehrtägige Entwicklungsaufgaben, bewertet agentenbasiert und nutzt ein abgestuftes Punktesystem, um KI-Assistenten beim Programmieren für Android zu messen.

Oossa · 2026-10-09 · https://oossa.com/de/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google hat Android Bench 2.0 veröffentlicht, eine überarbeitete Version seines Benchmarks für KI-Modelle, die Android-Apps entwickeln. Neu sind Langzeitaufgaben, für die Entwickler mehrere Tage oder sogar eine Woche brauchen können. Außerdem bewertet der Benchmark jetzt Agenten statt nur Codeausschnitte. Die Bewertung erfolgt nun abgestuft und berücksichtigt Funktionalität, visuelle Übereinstimmung und die Umsetzung von Anweisungen statt eines einfachen Bestanden-oder-nicht-bestanden-Urteils. Auf dem Dashboard liegt Claude Opus 5.5 bei den schwierigsten Aufgaben mit einer Erfolgsquote von 32 % vorn.

## Die Fakten

- Android Bench 2.0 wurde am 09.10.2026 angekündigt („Fri Oct 09 2026 19:00:00 GMT+0200“).
- Claude Opus 5.5 führte die LHT-Bestenliste mit einer Erfolgsquote von 32 % an.

## Warum es wichtig ist

Entwickler können mithilfe des Benchmarks erkennen, welche KI-Assistenten bei komplexen Android-Projekten am zuverlässigsten sind.

## Quellen und Referenzen

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
