# Sakana AI의 논문 검토 AI, 주장 오류 73% 잡아내

> Claude 기반 에이전트 3개로 구성된 새 검토 시스템이 핵심 주장 오류의 73.43%를 찾아냈다. 기존 최고 기록인 14.81%를 크게 웃도는 수치다.

Oossa · 2026-10-11 · https://oossa.com/ko/sakana-ai-s-review-ai-catches-73-of-claim-errors-in-test

Sakana AI는 대규모 언어 모델을 위한 새로운 동료 검토 시스템을 설명한 논문을 Transactions on Machine Learning Research(TMLR)에 발표했다. 이 시스템은 Claude 기반 에이전트 3개가 협력해 연구 주장의 오류를 찾는다. 알려진 모순 사례 1,164건을 대상으로 한 벤치마크에서 핵심 주장 오류의 73.43%를 잡아냈다. 이전 최고 성능 시스템은 같은 오류의 14.81%만 찾아냈다.

## 테스트 방식

Contradiction Benchmark라는 이름의 이 벤치마크에는 논문의 핵심 주장이 논문에 담긴 근거와 모순되는 사례 1,164건이 포함돼 있다. Sakana AI는 이 벤치마크에서 자사의 Multi-Layered Review(MLR) 에이전트를 테스트하고, 각 시스템이 찾아낸 오류 수를 기록했다. 공개된 수치는 Sakana AI 자체 평가 결과다.

## 팩트

- Sakana AI의 Multi-Layered Review는 Claude 기반 검토 에이전트 3개를 활용한다.
- 이 시스템은 오류 사례 1,164건으로 구성된 Contradiction Benchmark에서 테스트됐다.
- MLR은 핵심 주장 오류의 73.43%를 찾아냈다.
- 기존 최고 성능 시스템은 해당 오류의 14.81%만 찾아냈다.
- 결과는 2026년 10월 10일 TMLR 논문으로 발표됐다.

## 왜 중요한가

동료 검토 도구가 주장 오류 대부분을 찾아낼 수 있다면, 연구자들은 논문을 발표하기 전에 더 빠르게 피드백을 받을 수 있다. 독자 입장에서는 드러나지 않은 모순을 담은 논문이 줄어들 수 있다. 다만 이 결과는 아직 독립적인 검증이 필요하다.

## 출처 및 참고 자료

1. [Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors](https://www.marktechpost.com/2026/10/10/sakana-ais-llm-peer-review-system-catches-73-of-core-claim-errors/) – MarkTechPost, 2026-10-10

최종 업데이트: 2026-10-11
