Oossa

Google, 장기 과제·새 채점 방식 적용한 Android Bench 2.0 출시

업데이트된 벤치마크는 며칠에 걸친 개발 과제와 에이전트 기반 평가, 등급별 채점 시스템을 도입해 Android 코딩용 AI 비서를 측정한다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Google이 AI 모델의 Android 개발 역량을 평가하는 벤치마크를 개편해 Android Bench 2.0을 출시했다. 새 버전에는 엔지니어가 며칠에서 일주일까지 작업할 수 있는 장기 과제가 추가됐으며, 코드 조각만이 아니라 에이전트 자체를 평가한다. 기능, 시각적 충실도, 지시 준수 여부를 단순한 통과·실패로 판정하는 대신 연속적인 점수로 매긴다. 대시보드에서는 가장 어려운 과제에서 통과율 32%를 기록한 Claude Opus 5.5가 선두를 달리고 있다.

왜 중요한가

개발자는 이 벤치마크를 통해 복잡한 Android 프로젝트에 가장 믿고 쓸 수 있는 AI 비서가 무엇인지 확인할 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.