A Exa AI anunciou o ATLAS, um benchmark que mede a precisão e a abrangência de agentes de IA que recorrem à busca na web. Ele reúne 547 tarefas de pesquisa do mundo real, extraídas de demandas de busca anonimizadas. O benchmark mostra que até os agentes mais caros deixam de encontrar cerca de um terço dos resultados corretos e que nenhum sistema com custo inferior a $1 por tarefa alcança uma pontuação row F1 superior a 0.5.
Por que importa
Desenvolvedores podem usar o ATLAS para descobrir quais mecanismos de busca e configurações de agentes oferecem o melhor retorno pelo dinheiro investido, ajudando a criar ferramentas de pesquisa com IA mais confiáveis.