Exa AI a annoncé ATLAS, un benchmark qui mesure l’exactitude et l’exhaustivité des agents IA s’appuyant sur la recherche sur le Web. Il repose sur 547 tâches de recherche tirées de demandes anonymisées réelles. Le benchmark montre que même les agents les plus coûteux passent à côté d’environ un tiers des résultats pertinents et qu’aucun système facturé moins de $1 par tâche n’obtient un score row F1 supérieur à 0.5.
Pourquoi c'est important
Les développeurs peuvent utiliser ATLAS pour déterminer quels moteurs de recherche et quelles configurations d’agents offrent le meilleur rapport coût-efficacité, afin de créer des outils de recherche basés sur l’IA plus fiables.