# Exa推出ATLAS基准，评估智能体网页搜索能力

> 全新ATLAS基准根据AI智能体从真实网页搜索中获取结果的完整性和准确性进行评分，揭示了当前的成本与性能差距。

Oossa · 2026-10-08 · https://oossa.com/zh/exa-launches-atlas-benchmark-for-agentic-web-search

Exa AI宣布推出ATLAS，这是一项用于评估依赖网页搜索的AI智能体准确性和完整性的基准测试。它包含547项真实研究任务，取材于经过匿名处理的搜索需求。基准测试显示，即使是成本最高的智能体，也会漏掉约三分之一的正确结果；而每项任务成本低于1美元的系统，row F1分数都达不到0.5。

## 事实

- 涵盖深度和广度研究场景的547项任务
- 每项任务成本低于1美元的智能体，row F1分数均不超过0.5

## 为什么重要

开发者可以借助ATLAS找出性价比最高的搜索后端和智能体配置，从而打造更可靠的AI研究工具。

## 来源与参考

1. [Introducing ATLAS: A new benchmark for agentic search](https://exa.ai/blog/atlas-benchmark) – Exa

最后更新: 2026-10-08
