# Google推出Android Bench 2.0：新增长期任务与评分体系

> 新版基准测试加入历时数天的开发任务，采用智能体评估和分级评分，衡量AI助手的Android编程能力。

Oossa · 2026-10-09 · https://oossa.com/zh/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google发布了Android Bench 2.0，这是其面向AI模型的Android开发基准测试的升级版。新版本加入了长期任务，完成这些任务可能需要工程师花上几天甚至一周；评估对象也从代码片段扩展到了智能体。评分方式改为连续评分，评估功能、视觉还原度和指令遵循情况，而不再只是简单判定通过或不通过。仪表板显示，Claude Opus 5.5在难度最高的任务中以32%的通过率领先。

## 事实

- Android Bench 2.0于2026-10-09宣布（“Fri Oct 09 2026 19:00:00 GMT+0200”）。
- Claude Opus 5.5以32%的通过率位居LHT排行榜首位。

## 为什么重要

开发者可以借助这项基准测试，了解哪些AI助手在复杂Android项目中更可靠。

## 来源与参考

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

最后更新: 2026-10-09
