Oossa

Google stellt Android Bench 2.0 mit Langzeitaufgaben vor

Der aktualisierte Benchmark umfasst mehrtägige Entwicklungsaufgaben, bewertet agentenbasiert und nutzt ein abgestuftes Punktesystem, um KI-Assistenten beim Programmieren für Android zu messen.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Google hat Android Bench 2.0 veröffentlicht, eine überarbeitete Version seines Benchmarks für KI-Modelle, die Android-Apps entwickeln. Neu sind Langzeitaufgaben, für die Entwickler mehrere Tage oder sogar eine Woche brauchen können. Außerdem bewertet der Benchmark jetzt Agenten statt nur Codeausschnitte. Die Bewertung erfolgt nun abgestuft und berücksichtigt Funktionalität, visuelle Übereinstimmung und die Umsetzung von Anweisungen statt eines einfachen Bestanden-oder-nicht-bestanden-Urteils. Auf dem Dashboard liegt Claude Opus 5.5 bei den schwierigsten Aufgaben mit einer Erfolgsquote von 32 % vorn.

Warum es wichtig ist

Entwickler können mithilfe des Benchmarks erkennen, welche KI-Assistenten bei komplexen Android-Projekten am zuverlässigsten sind.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.