# Google lança o Android Bench 2.0, com tarefas longas e nova pontuação

> A atualização inclui tarefas de desenvolvimento que duram vários dias, avaliação baseada em agentes e um sistema de notas graduadas para medir assistentes de IA na programação para Android.

Oossa · 2026-10-09 · https://oossa.com/pt/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

O Google lançou o Android Bench 2.0, uma atualização de seu benchmark para avaliar modelos de IA no desenvolvimento para Android. A nova versão inclui tarefas de longa duração, que podem levar dias ou uma semana para serem concluídas por um engenheiro, e avalia agentes, não apenas trechos de código. A pontuação agora é gradual e considera funcionalidade, fidelidade visual e cumprimento das instruções, em vez de uma simples classificação de aprovado ou reprovado. O painel mostra o Claude Opus 5.5 na liderança, com uma taxa de aprovação de 32% nas tarefas mais difíceis.

## Os fatos

- O Android Bench 2.0 foi anunciado em 2026-10-09 ("Fri Oct 09 2026 19:00:00 GMT+0200").
- O Claude Opus 5.5 liderou o placar de LHT, com uma taxa de aprovação de 32%.

## Por que importa

O benchmark permite que desenvolvedores identifiquem quais assistentes de IA são mais confiáveis para projetos complexos de Android.

## Fontes e referências

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Última atualização: 2026-10-09
