Exa AI anunció ATLAS, un benchmark que mide la precisión y la exhaustividad de los agentes de IA que recurren a la búsqueda web. Utiliza 547 tareas de investigación del mundo real, extraídas de la demanda de búsqueda anonimizada. El benchmark muestra que incluso los agentes más costosos pasan por alto alrededor de un tercio de los resultados correctos y que ningún sistema que cueste menos de $1 por tarea alcanza una puntuación row F1 superior a 0.5.
Por qué importa
Los desarrolladores pueden usar ATLAS para identificar qué sistemas de búsqueda y configuraciones de agentes ofrecen la mejor relación costo-beneficio, y así crear herramientas de investigación con IA más confiables.