Exa AI宣布推出ATLAS,这是一项用于评估依赖网页搜索的AI智能体准确性和完整性的基准测试。它包含547项真实研究任务,取材于经过匿名处理的搜索需求。基准测试显示,即使是成本最高的智能体,也会漏掉约三分之一的正确结果;而每项任务成本低于1美元的系统,row F1分数都达不到0.5。
为什么重要
开发者可以借助ATLAS找出性价比最高的搜索后端和智能体配置,从而打造更可靠的AI研究工具。
全新ATLAS基准根据AI智能体从真实网页搜索中获取结果的完整性和准确性进行评分,揭示了当前的成本与性能差距。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
Exa AI宣布推出ATLAS,这是一项用于评估依赖网页搜索的AI智能体准确性和完整性的基准测试。它包含547项真实研究任务,取材于经过匿名处理的搜索需求。基准测试显示,即使是成本最高的智能体,也会漏掉约三分之一的正确结果;而每项任务成本低于1美元的系统,row F1分数都达不到0.5。
开发者可以借助ATLAS找出性价比最高的搜索后端和智能体配置,从而打造更可靠的AI研究工具。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。