Google выпустила Android Bench 2.0 — обновлённую версию бенчмарка для оценки ИИ-моделей в разработке под Android. В новой версии появились задачи с длительным горизонтом, на выполнение которых у инженера могут уйти дни или целая неделя. Кроме того, теперь оцениваются агенты, а не только отдельные фрагменты кода. Вместо простой оценки «выполнено/не выполнено» используется градуированная система, учитывающая функциональность, визуальное соответствие и следование инструкциям. Согласно панели результатов, Claude Opus 5.5 лидирует с показателем успешного выполнения 32% на самых сложных задачах.
Почему это важно
Бенчмарк поможет разработчикам понять, какие ИИ-помощники надёжнее справляются со сложными проектами для Android.