Google이 AI 모델의 Android 개발 역량을 평가하는 벤치마크를 개편해 Android Bench 2.0을 출시했다. 새 버전에는 엔지니어가 며칠에서 일주일까지 작업할 수 있는 장기 과제가 추가됐으며, 코드 조각만이 아니라 에이전트 자체를 평가한다. 기능, 시각적 충실도, 지시 준수 여부를 단순한 통과·실패로 판정하는 대신 연속적인 점수로 매긴다. 대시보드에서는 가장 어려운 과제에서 통과율 32%를 기록한 Claude Opus 5.5가 선두를 달리고 있다.
왜 중요한가
개발자는 이 벤치마크를 통해 복잡한 Android 프로젝트에 가장 믿고 쓸 수 있는 AI 비서가 무엇인지 확인할 수 있다.