Google hat Android Bench 2.0 veröffentlicht, eine überarbeitete Version seines Benchmarks für KI-Modelle, die Android-Apps entwickeln. Neu sind Langzeitaufgaben, für die Entwickler mehrere Tage oder sogar eine Woche brauchen können. Außerdem bewertet der Benchmark jetzt Agenten statt nur Codeausschnitte. Die Bewertung erfolgt nun abgestuft und berücksichtigt Funktionalität, visuelle Übereinstimmung und die Umsetzung von Anweisungen statt eines einfachen Bestanden-oder-nicht-bestanden-Urteils. Auf dem Dashboard liegt Claude Opus 5.5 bei den schwierigsten Aufgaben mit einer Erfolgsquote von 32 % vorn.
Warum es wichtig ist
Entwickler können mithilfe des Benchmarks erkennen, welche KI-Assistenten bei komplexen Android-Projekten am zuverlässigsten sind.