# Google lance Android Bench 2.0, avec des tâches longues et une nouvelle notation

> La mise à jour ajoute des tâches de développement sur plusieurs jours, une évaluation par agents et un système de notation graduée pour mesurer les capacités des assistants IA en programmation Android.

Oossa · 2026-10-09 · https://oossa.com/fr/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google a lancé Android Bench 2.0, une mise à jour de son benchmark de développement Android pour les modèles d’IA. Cette nouvelle version ajoute des tâches de longue durée, qui peuvent demander plusieurs jours, voire une semaine, à un ingénieur. Elle évalue les agents plutôt que de simples extraits de code. La notation est désormais continue : elle évalue le fonctionnement, la fidélité visuelle et le respect des consignes, au lieu de se limiter à un résultat binaire. Le tableau de bord place Claude Opus 5.5 en tête, avec un taux de réussite de 32 % pour les tâches les plus difficiles.

## Les faits

- Android Bench 2.0 a été annoncé le 2026-10-09 (« Fri Oct 09 2026 19:00:00 GMT+0200 »).
- Claude Opus 5.5 est arrivé en tête du classement LHT, avec un taux de réussite de 32 %. 

## Pourquoi c'est important

Ce benchmark permet aux développeurs de voir quels assistants IA sont les plus fiables pour les projets Android complexes.

## Sources et références

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Dernière mise à jour: 2026-10-09
