Google a lancé Android Bench 2.0, une mise à jour de son benchmark de développement Android pour les modèles d’IA. Cette nouvelle version ajoute des tâches de longue durée, qui peuvent demander plusieurs jours, voire une semaine, à un ingénieur. Elle évalue les agents plutôt que de simples extraits de code. La notation est désormais continue : elle évalue le fonctionnement, la fidélité visuelle et le respect des consignes, au lieu de se limiter à un résultat binaire. Le tableau de bord place Claude Opus 5.5 en tête, avec un taux de réussite de 32 % pour les tâches les plus difficiles.
Pourquoi c'est important
Ce benchmark permet aux développeurs de voir quels assistants IA sont les plus fiables pour les projets Android complexes.