Oossa

Google lança o Android Bench 2.0, com tarefas longas e nova pontuação

A atualização inclui tarefas de desenvolvimento que duram vários dias, avaliação baseada em agentes e um sistema de notas graduadas para medir assistentes de IA na programação para Android.

NotaPor Publicado pelo Oossa: 1 min de leitura

O Google lançou o Android Bench 2.0, uma atualização de seu benchmark para avaliar modelos de IA no desenvolvimento para Android. A nova versão inclui tarefas de longa duração, que podem levar dias ou uma semana para serem concluídas por um engenheiro, e avalia agentes, não apenas trechos de código. A pontuação agora é gradual e considera funcionalidade, fidelidade visual e cumprimento das instruções, em vez de uma simples classificação de aprovado ou reprovado. O painel mostra o Claude Opus 5.5 na liderança, com uma taxa de aprovação de 32% nas tarefas mais difíceis.

Por que importa

O benchmark permite que desenvolvedores identifiquem quais assistentes de IA são mais confiáveis para projetos complexos de Android.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.