# Exa、AIエージェントのウェブ検索を評価する「ATLAS」公開

> 新ベンチマーク「ATLAS」は、実際のウェブ検索でAIエージェントがどれだけ網羅的かつ正確な結果を得られるかを評価し、現状のコストと性能の課題を浮き彫りにする。

Oossa · 2026-10-08 · https://oossa.com/ja/exa-launches-atlas-benchmark-for-agentic-web-search

Exa AIは、ウェブ検索に頼るAIエージェントの正確性と網羅性を測るベンチマーク「ATLAS」を発表した。匿名化された検索需要をもとに作成した、現実の調査タスク547件を使用する。このベンチマークでは、最も高価なエージェントでも正解の約3分の1を見落とし、1タスクあたりの費用が$1未満のシステムは、row F1スコアが0.5を超えないことが示された。

## 事実

- 幅広く深い調査シナリオを対象とする547件のタスク
- 1タスクあたりの費用が$1未満のエージェントは、row F1スコアが0.5を超えない

## なぜ重要か

開発者はATLASを使って、どの検索バックエンドやエージェント構成が費用に見合う成果を上げるかを見極め、より信頼性の高いAI調査ツールの開発に役立てられる。

## 出典と参考資料

1. [Introducing ATLAS: A new benchmark for agentic search](https://exa.ai/blog/atlas-benchmark) – Exa

最終更新: 2026-10-08
