Sakana AI는 대규모 언어 모델을 위한 새로운 동료 검토 시스템을 설명한 논문을 Transactions on Machine Learning Research(TMLR)에 발표했다. 이 시스템은 Claude 기반 에이전트 3개가 협력해 연구 주장의 오류를 찾는다. 알려진 모순 사례 1,164건을 대상으로 한 벤치마크에서 핵심 주장 오류의 73.43%를 잡아냈다. 이전 최고 성능 시스템은 같은 오류의 14.81%만 찾아냈다.
테스트 방식
Contradiction Benchmark라는 이름의 이 벤치마크에는 논문의 핵심 주장이 논문에 담긴 근거와 모순되는 사례 1,164건이 포함돼 있다. Sakana AI는 이 벤치마크에서 자사의 Multi-Layered Review(MLR) 에이전트를 테스트하고, 각 시스템이 찾아낸 오류 수를 기록했다. 공개된 수치는 Sakana AI 자체 평가 결과다.
왜 중요한가
동료 검토 도구가 주장 오류 대부분을 찾아낼 수 있다면, 연구자들은 논문을 발표하기 전에 더 빠르게 피드백을 받을 수 있다. 독자 입장에서는 드러나지 않은 모순을 담은 논문이 줄어들 수 있다. 다만 이 결과는 아직 독립적인 검증이 필요하다.