Oossa

Google выпустила Android Bench 2.0 с длительными задачами и новой системой оценки

Обновлённый бенчмарк включает задачи по разработке на несколько дней, оценку ИИ-агентов и градуированную систему баллов для проверки помощников в программировании под Android.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Google выпустила Android Bench 2.0 — обновлённую версию бенчмарка для оценки ИИ-моделей в разработке под Android. В новой версии появились задачи с длительным горизонтом, на выполнение которых у инженера могут уйти дни или целая неделя. Кроме того, теперь оцениваются агенты, а не только отдельные фрагменты кода. Вместо простой оценки «выполнено/не выполнено» используется градуированная система, учитывающая функциональность, визуальное соответствие и следование инструкциям. Согласно панели результатов, Claude Opus 5.5 лидирует с показателем успешного выполнения 32% на самых сложных задачах.

Почему это важно

Бенчмарк поможет разработчикам понять, какие ИИ-помощники надёжнее справляются со сложными проектами для Android.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.