Oossa

Google lance Android Bench 2.0, avec des tâches longues et une nouvelle notation

La mise à jour ajoute des tâches de développement sur plusieurs jours, une évaluation par agents et un système de notation graduée pour mesurer les capacités des assistants IA en programmation Android.

BrèvePar Publié par Oossa: 1 min de lecture

Google a lancé Android Bench 2.0, une mise à jour de son benchmark de développement Android pour les modèles d’IA. Cette nouvelle version ajoute des tâches de longue durée, qui peuvent demander plusieurs jours, voire une semaine, à un ingénieur. Elle évalue les agents plutôt que de simples extraits de code. La notation est désormais continue : elle évalue le fonctionnement, la fidélité visuelle et le respect des consignes, au lieu de se limiter à un résultat binaire. Le tableau de bord place Claude Opus 5.5 en tête, avec un taux de réussite de 32 % pour les tâches les plus difficiles.

Pourquoi c'est important

Ce benchmark permet aux développeurs de voir quels assistants IA sont les plus fiables pour les projets Android complexes.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.