Компания Exa AI представила ATLAS — бенчмарк для оценки точности и полноты работы ИИ-агентов, использующих веб-поиск. В него вошли 547 реальных исследовательских задач, составленных на основе анонимизированных поисковых запросов. Бенчмарк показывает, что даже самые дорогие агенты пропускают около трети нужных результатов, а ни одна система стоимостью менее $1 за задачу не набирает row F1 выше 0.5.
Почему это важно
Разработчики могут использовать ATLAS, чтобы выяснить, какие поисковые системы и настройки агентов обеспечивают наилучшую отдачу за потраченные деньги, и создавать более надёжные инструменты для исследований с помощью ИИ.