Oossa

Sakana AI评审系统在测试中发现73%的论断错误

这款由三个基于Claude的智能体组成的评审系统发现了73.43%的核心论断错误,远高于此前最佳系统的14.81%。

作者: Oossa 发布日期: 1 分钟阅读

Andreea Avramescu · Unsplash

Sakana AI在《机器学习研究汇刊》(TMLR)上发表论文,介绍了一套面向大型语言模型的新同行评审系统。该系统由三个基于Claude的智能体协作运行,用于发现研究论断中的错误。在一项包含1,164处已知矛盾的基准测试中,系统标出了73.43%的核心论断错误。此前表现最佳的系统只发现了其中14.81%。

测试设置

这项名为“矛盾基准测试”(Contradiction Benchmark)的测试收录了1,164个案例,每个案例中,论文的主要论断都与其自身证据相矛盾。Sakana AI让其多层评审(MLR)智能体对这些案例进行检测,并统计各系统发现的错误数量。公布的数据来自Sakana AI自行开展的评估。

为什么重要

如果同行评审工具能够发现大多数论断错误,研究人员或许能在发表前更快获得反馈。对读者来说,这也可能意味着公开发表的论文中隐藏矛盾会更少。不过,这些结果仍需独立验证。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。