# Google выпустила Android Bench 2.0 с длительными задачами и новой системой оценки

> Обновлённый бенчмарк включает задачи по разработке на несколько дней, оценку ИИ-агентов и градуированную систему баллов для проверки помощников в программировании под Android.

Oossa · 2026-10-09 · https://oossa.com/ru/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google выпустила Android Bench 2.0 — обновлённую версию бенчмарка для оценки ИИ-моделей в разработке под Android. В новой версии появились задачи с длительным горизонтом, на выполнение которых у инженера могут уйти дни или целая неделя. Кроме того, теперь оцениваются агенты, а не только отдельные фрагменты кода. Вместо простой оценки «выполнено/не выполнено» используется градуированная система, учитывающая функциональность, визуальное соответствие и следование инструкциям. Согласно панели результатов, Claude Opus 5.5 лидирует с показателем успешного выполнения 32% на самых сложных задачах.

## Факты

- Android Bench 2.0 анонсирован 2026-10-09 ("Fri Oct 09 2026 19:00:00 GMT+0200").
- Claude Opus 5.5 занял первое место в таблице LHT с показателем успешного выполнения 32%.

## Почему это важно

Бенчмарк поможет разработчикам понять, какие ИИ-помощники надёжнее справляются со сложными проектами для Android.

## Источники и ссылки

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Обновлено: 2026-10-09
