# Google presenta Android Bench 2.0, con tareas largas y nuevas puntuaciones

> La nueva versión incorpora tareas de desarrollo que duran varios días, evaluación de agentes y un sistema de puntuación gradual para medir asistentes de IA que programan para Android.

Oossa · 2026-10-09 · https://oossa.com/es/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google lanzó Android Bench 2.0, una actualización de su benchmark para evaluar modelos de IA en el desarrollo para Android. La nueva versión incorpora tareas de largo plazo que pueden llevarle varios días o una semana a un ingeniero, y evalúa agentes, no solo fragmentos de código. Ahora la puntuación es gradual y evalúa la funcionalidad, la fidelidad visual y el cumplimiento de las instrucciones, en lugar de limitarse a aprobar o suspender. El panel muestra a Claude Opus 5.5 a la cabeza, con una tasa de aprobación del 32% en las tareas más difíciles.

## Los hechos

- Android Bench 2.0 se anunció el 2026-10-09 ("Fri Oct 09 2026 19:00:00 GMT+0200").
- Claude Opus 5.5 encabezó la clasificación LHT con una tasa de aprobación del 32%.

## Por qué importa

Los desarrolladores pueden usar el benchmark para saber qué asistentes de IA son más fiables en proyectos complejos de Android.

## Fuentes y referencias

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Última actualización: 2026-10-09
