Googleは、AIモデル向けのAndroid開発ベンチマークを刷新した「Android Bench 2.0」を公開した。新バージョンでは、エンジニアが数日から1週間かけて取り組むような長期タスクを追加し、コード断片だけでなくエージェントも評価する。採点方式も段階評価に変わり、単純な合否ではなく、機能性、視覚的な忠実度、指示への準拠度を判定する。ダッシュボードでは、最難関タスクで合格率32%を記録したClaude Opus 5.5が首位に立っている。
なぜ重要か
開発者はこのベンチマークを使って、複雑なAndroidプロジェクトで最も信頼できるAIアシスタントを見極められる。