Oossa

Exa lance ATLAS, un benchmark pour la recherche web par agents IA

Le nouveau benchmark ATLAS évalue la capacité des agents IA à extraire des résultats complets et exacts lors de recherches sur le Web, et met en évidence les limites actuelles en matière de coût et de performances.

BrèvePar Publié par Oossa: 1 min de lecture

Exa AI a annoncé ATLAS, un benchmark qui mesure l’exactitude et l’exhaustivité des agents IA s’appuyant sur la recherche sur le Web. Il repose sur 547 tâches de recherche tirées de demandes anonymisées réelles. Le benchmark montre que même les agents les plus coûteux passent à côté d’environ un tiers des résultats pertinents et qu’aucun système facturé moins de $1 par tâche n’obtient un score row F1 supérieur à 0.5.

Pourquoi c'est important

Les développeurs peuvent utiliser ATLAS pour déterminer quels moteurs de recherche et quelles configurations d’agents offrent le meilleur rapport coût-efficacité, afin de créer des outils de recherche basés sur l’IA plus fiables.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.