Exa AIは、ウェブ検索に頼るAIエージェントの正確性と網羅性を測るベンチマーク「ATLAS」を発表した。匿名化された検索需要をもとに作成した、現実の調査タスク547件を使用する。このベンチマークでは、最も高価なエージェントでも正解の約3分の1を見落とし、1タスクあたりの費用が$1未満のシステムは、row F1スコアが0.5を超えないことが示された。
なぜ重要か
開発者はATLASを使って、どの検索バックエンドやエージェント構成が費用に見合う成果を上げるかを見極め、より信頼性の高いAI調査ツールの開発に役立てられる。