Oossa

Google presenta Android Bench 2.0, con tareas largas y nuevas puntuaciones

La nueva versión incorpora tareas de desarrollo que duran varios días, evaluación de agentes y un sistema de puntuación gradual para medir asistentes de IA que programan para Android.

BrevePor Publicado por Oossa: 1 min de lectura

Google lanzó Android Bench 2.0, una actualización de su benchmark para evaluar modelos de IA en el desarrollo para Android. La nueva versión incorpora tareas de largo plazo que pueden llevarle varios días o una semana a un ingeniero, y evalúa agentes, no solo fragmentos de código. Ahora la puntuación es gradual y evalúa la funcionalidad, la fidelidad visual y el cumplimiento de las instrucciones, en lugar de limitarse a aprobar o suspender. El panel muestra a Claude Opus 5.5 a la cabeza, con una tasa de aprobación del 32% en las tareas más difíciles.

Por qué importa

Los desarrolladores pueden usar el benchmark para saber qué asistentes de IA son más fiables en proyectos complejos de Android.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.