# Sakana AIの査読AI、主張の誤りを73％検出

> Claudeベースの3つのエージェントを使う新システムは、主張の核心に関わる誤りを73.43％検出。従来の最高記録は14.81％だった。

Oossa · 2026-10-11 · https://oossa.com/ja/sakana-ai-s-review-ai-catches-73-of-claim-errors-in-test

Sakana AIは、Transactions on Machine Learning Research（TMLR）で、大規模言語モデル向けの新たな査読システムを説明する論文を発表した。このシステムでは、Claudeベースの3つのエージェントが連携し、研究上の主張に含まれる誤りを探す。既知の矛盾を集めた1,164件のベンチマークでは、主張の核心に関わる誤りの73.43％を検出した。従来の最高記録は、同じ誤りの14.81％にとどまっていた。

## テストの方法

「Contradiction Benchmark」と呼ばれるこのベンチマークには、論文の主要な主張が自らの根拠と矛盾する事例が1,164件含まれる。Sakana AIはこのベンチマークで、Multi-Layered Review（MLR）のエージェントを評価し、各システムが検出した誤りの数を記録した。公表された数値は、Sakana AIによる独自評価の結果だ。

## 事実

- Sakana AIのMulti-Layered Reviewは、Claudeベースの査読エージェント3つを使う。
- 1,164件の誤りを含むContradiction Benchmarkでテストされた。
- MLRは主張の核心に関わる誤りの73.43％を検出した。
- 従来の最高記録は、そうした誤りの14.81％にとどまっていた。
- この結果は2026年10月10日、TMLRの論文で発表された。

## なぜ重要か

査読支援ツールが主張の誤りの大半を見つけられれば、研究者は論文の発表前に、より早くフィードバックを得られる可能性がある。読者にとっては、見えにくい矛盾を含む論文が減ることにもつながりうる。ただし、今回の結果は独立した検証が必要だ。

## 出典と参考資料

1. [Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors](https://www.marktechpost.com/2026/10/10/sakana-ais-llm-peer-review-system-catches-73-of-core-claim-errors/) – MarkTechPost, 2026-10-10

最終更新: 2026-10-11
