# Google、長期タスクと新たな採点方式を導入した「Android Bench 2.0」を発表

> 新ベンチマークでは、複数日にわたる開発タスクやエージェントベースの評価、段階的な採点方式を取り入れ、Android開発向けAIアシスタントの性能を測定する。

Oossa · 2026-10-09 · https://oossa.com/ja/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Googleは、AIモデル向けのAndroid開発ベンチマークを刷新した「Android Bench 2.0」を公開した。新バージョンでは、エンジニアが数日から1週間かけて取り組むような長期タスクを追加し、コード断片だけでなくエージェントも評価する。採点方式も段階評価に変わり、単純な合否ではなく、機能性、視覚的な忠実度、指示への準拠度を判定する。ダッシュボードでは、最難関タスクで合格率32%を記録したClaude Opus 5.5が首位に立っている。

## 事実

- Android Bench 2.0は2026-10-09（「Fri Oct 09 2026 19:00:00 GMT+0200」）に発表された。
- LHTリーダーボードでは、Claude Opus 5.5が合格率32%で首位となった。

## なぜ重要か

開発者はこのベンチマークを使って、複雑なAndroidプロジェクトで最も信頼できるAIアシスタントを見極められる。

## 出典と参考資料

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

最終更新: 2026-10-09
