O Google lançou o Android Bench 2.0, uma atualização de seu benchmark para avaliar modelos de IA no desenvolvimento para Android. A nova versão inclui tarefas de longa duração, que podem levar dias ou uma semana para serem concluídas por um engenheiro, e avalia agentes, não apenas trechos de código. A pontuação agora é gradual e considera funcionalidade, fidelidade visual e cumprimento das instruções, em vez de uma simples classificação de aprovado ou reprovado. O painel mostra o Claude Opus 5.5 na liderança, com uma taxa de aprovação de 32% nas tarefas mais difíceis.
Por que importa
O benchmark permite que desenvolvedores identifiquem quais assistentes de IA são mais confiáveis para projetos complexos de Android.