Oossa

Exa lanza ATLAS, una prueba de búsqueda web para agentes de IA

El nuevo benchmark ATLAS evalúa qué tan bien recuperan los agentes de IA resultados completos y precisos mediante búsquedas web reales, y pone de manifiesto las brechas actuales de costo y rendimiento.

BrevePor Publicado por Oossa: 1 min de lectura

Exa AI anunció ATLAS, un benchmark que mide la precisión y la exhaustividad de los agentes de IA que recurren a la búsqueda web. Utiliza 547 tareas de investigación del mundo real, extraídas de la demanda de búsqueda anonimizada. El benchmark muestra que incluso los agentes más costosos pasan por alto alrededor de un tercio de los resultados correctos y que ningún sistema que cueste menos de $1 por tarea alcanza una puntuación row F1 superior a 0.5.

Por qué importa

Los desarrolladores pueden usar ATLAS para identificar qué sistemas de búsqueda y configuraciones de agentes ofrecen la mejor relación costo-beneficio, y así crear herramientas de investigación con IA más confiables.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.