# Sakana AI评审系统在测试中发现73%的论断错误

> 这款由三个基于Claude的智能体组成的评审系统发现了73.43%的核心论断错误，远高于此前最佳系统的14.81%。

Oossa · 2026-10-11 · https://oossa.com/zh/sakana-ai-s-review-ai-catches-73-of-claim-errors-in-test

Sakana AI在《机器学习研究汇刊》（TMLR）上发表论文，介绍了一套面向大型语言模型的新同行评审系统。该系统由三个基于Claude的智能体协作运行，用于发现研究论断中的错误。在一项包含1,164处已知矛盾的基准测试中，系统标出了73.43%的核心论断错误。此前表现最佳的系统只发现了其中14.81%。

## 测试设置

这项名为“矛盾基准测试”（Contradiction Benchmark）的测试收录了1,164个案例，每个案例中，论文的主要论断都与其自身证据相矛盾。Sakana AI让其多层评审（MLR）智能体对这些案例进行检测，并统计各系统发现的错误数量。公布的数据来自Sakana AI自行开展的评估。

## 事实

- Sakana AI的多层评审（MLR）系统采用三个基于Claude的评审智能体。
- 该系统在包含1,164处错误的矛盾基准测试中接受测试。
- MLR发现了73.43%的核心论断错误。
- 此前表现最佳的系统只发现了其中14.81%。
- 相关结果发表于TMLR的一篇论文，发布日期为2026年10月10日。

## 为什么重要

如果同行评审工具能够发现大多数论断错误，研究人员或许能在发表前更快获得反馈。对读者来说，这也可能意味着公开发表的论文中隐藏矛盾会更少。不过，这些结果仍需独立验证。

## 来源与参考

1. [Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors](https://www.marktechpost.com/2026/10/10/sakana-ais-llm-peer-review-system-catches-73-of-core-claim-errors/) – MarkTechPost, 2026-10-10

最后更新: 2026-10-11
