Exa AI가 웹 검색을 활용하는 AI 에이전트의 정확성과 완전성을 측정하는 벤치마크 ATLAS를 발표했다. 익명화된 검색 수요를 바탕으로 실제 연구 과제 547개를 사용한다. 벤치마크 결과, 가장 비싼 에이전트조차 정답의 약 3분의 1을 놓치며, 과제당 비용이 $1 미만인 시스템 중 행 F1 점수가 0.5를 넘는 것은 없는 것으로 나타났다.
왜 중요한가
개발자는 ATLAS를 활용해 어떤 검색 백엔드와 에이전트 구성이 비용 대비 효과가 가장 좋은지 파악하고, 이를 바탕으로 더 신뢰할 수 있는 AI 기반 조사 도구를 만들 수 있다.