Sakana AIは、Transactions on Machine Learning Research(TMLR)で、大規模言語モデル向けの新たな査読システムを説明する論文を発表した。このシステムでは、Claudeベースの3つのエージェントが連携し、研究上の主張に含まれる誤りを探す。既知の矛盾を集めた1,164件のベンチマークでは、主張の核心に関わる誤りの73.43%を検出した。従来の最高記録は、同じ誤りの14.81%にとどまっていた。
テストの方法
「Contradiction Benchmark」と呼ばれるこのベンチマークには、論文の主要な主張が自らの根拠と矛盾する事例が1,164件含まれる。Sakana AIはこのベンチマークで、Multi-Layered Review(MLR)のエージェントを評価し、各システムが検出した誤りの数を記録した。公表された数値は、Sakana AIによる独自評価の結果だ。
なぜ重要か
査読支援ツールが主張の誤りの大半を見つけられれば、研究者は論文の発表前に、より早くフィードバックを得られる可能性がある。読者にとっては、見えにくい矛盾を含む論文が減ることにもつながりうる。ただし、今回の結果は独立した検証が必要だ。