# Google, 장기 과제·새 채점 방식 적용한 Android Bench 2.0 출시

> 업데이트된 벤치마크는 며칠에 걸친 개발 과제와 에이전트 기반 평가, 등급별 채점 시스템을 도입해 Android 코딩용 AI 비서를 측정한다.

Oossa · 2026-10-09 · https://oossa.com/ko/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google이 AI 모델의 Android 개발 역량을 평가하는 벤치마크를 개편해 Android Bench 2.0을 출시했다. 새 버전에는 엔지니어가 며칠에서 일주일까지 작업할 수 있는 장기 과제가 추가됐으며, 코드 조각만이 아니라 에이전트 자체를 평가한다. 기능, 시각적 충실도, 지시 준수 여부를 단순한 통과·실패로 판정하는 대신 연속적인 점수로 매긴다. 대시보드에서는 가장 어려운 과제에서 통과율 32%를 기록한 Claude Opus 5.5가 선두를 달리고 있다.

## 팩트

- Android Bench 2.0은 2026-10-09("Fri Oct 09 2026 19:00:00 GMT+0200")에 발표됐다.
- Claude Opus 5.5가 LHT 순위표에서 통과율 32%로 1위를 차지했다.

## 왜 중요한가

개발자는 이 벤치마크를 통해 복잡한 Android 프로젝트에 가장 믿고 쓸 수 있는 AI 비서가 무엇인지 확인할 수 있다.

## 출처 및 참고 자료

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

최종 업데이트: 2026-10-09
