Sakana AI在《机器学习研究汇刊》(TMLR)上发表论文,介绍了一套面向大型语言模型的新同行评审系统。该系统由三个基于Claude的智能体协作运行,用于发现研究论断中的错误。在一项包含1,164处已知矛盾的基准测试中,系统标出了73.43%的核心论断错误。此前表现最佳的系统只发现了其中14.81%。
测试设置
这项名为“矛盾基准测试”(Contradiction Benchmark)的测试收录了1,164个案例,每个案例中,论文的主要论断都与其自身证据相矛盾。Sakana AI让其多层评审(MLR)智能体对这些案例进行检测,并统计各系统发现的错误数量。公布的数据来自Sakana AI自行开展的评估。
为什么重要
如果同行评审工具能够发现大多数论断错误,研究人员或许能在发表前更快获得反馈。对读者来说,这也可能意味着公开发表的论文中隐藏矛盾会更少。不过,这些结果仍需独立验证。