由Xuanwang Zhang领衔的研究团队于6 October 2026发布了题为WebNavigator的论文。该系统改变了AI代理浏览网站的方式:它不再靠反复试错摸索,而是先离线绘制可执行操作的地图,再在线据此选择正确步骤。在WebArena基准测试中,WebNavigator完成了72.9%的多站点任务,成功率是此前报告的最佳商业代理的两倍以上。
方法如何运作
WebNavigator会创建一张交互图,相当于一份路线图,记录网站上所有可点击元素和表单。它通过一种“零Token成本”的探索方式生成这张图;由于探索在离线状态下进行,因此不会消耗API额度。收到任务后,代理会依照“检索—推理—瞬移”流程操作:先提取图中相关部分,再判断最佳路径,随后直接跳转到所需页面。作者将此前缺少全局地图的情况称为“拓扑盲区”。
表现与意义
在WebArena多站点测试套件中,这种新方法的成功率达到72.9%。论文称,这一表现是“企业级代理”的两倍以上。它在OnlineMind2Web基准测试中也表现出色,但摘要未列出具体数据。这项研究表明,让代理获得网站的全局视图,可能比改进底层语言模型更重要。
为什么重要
对于开发表单填写或数据抓取机器人的开发者来说,更高的成功率意味着失败尝试更少,也无需那么多人工修复。这种方法有望减少成本高昂的反复试错,让自动化网页服务运行得更快、成本更低。不过,论文尚未说明该方法在布局频繁变化的网站上效果如何。