Google lanzó Android Bench 2.0, una actualización de su benchmark para evaluar modelos de IA en el desarrollo para Android. La nueva versión incorpora tareas de largo plazo que pueden llevarle varios días o una semana a un ingeniero, y evalúa agentes, no solo fragmentos de código. Ahora la puntuación es gradual y evalúa la funcionalidad, la fidelidad visual y el cumplimiento de las instrucciones, en lugar de limitarse a aprobar o suspender. El panel muestra a Claude Opus 5.5 a la cabeza, con una tasa de aprobación del 32% en las tareas más difíciles.
Por qué importa
Los desarrolladores pueden usar el benchmark para saber qué asistentes de IA son más fiables en proyectos complejos de Android.