# Aleph Alpha, 근거 없는 답변 걸러내는 LLM 훈련법 공개

> 새로운 Merlin‑Arthur 훈련 방식은 문서에 답이 없을 때 모델이 “모르겠습니다”라고 답하게 해 환각을 최대 35%포인트 줄인다.

Oossa · 2026-09-29 · https://oossa.com/ko/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha가 제공된 문서에 필요한 정보가 없을 때 언어 모델이 답변을 거부하도록 훈련하는 방법을 공개했다. Merlin‑Arthur 프로토콜이라 불리는 이 기법은 모델(Arthur)이 두 조력자와 대결하는 방식이다. 전체 문단을 제공하는 Merlin과 결정적인 문장을 삭제하는 Morgana가 조력자로 나선다. 훈련 중 Arthur는 어느 쪽을 상대하는지 알 수 없기 때문에, 근거가 있을 때만 답하고 그렇지 않으면 답변을 유보하는 법을 배운다. 5개 QA 벤치마크에서 오답은 최대 35%포인트 줄었고, 새로운 ‘근거성 점수’는 최대 0.38 상승했다.

## 팩트

- 논문은 arXiv에 2512.11614로 게시됐다(2026년 8월 8일).
- 오답은 최대 35%포인트 줄었고, 근거성 점수는 최대 0.38 개선됐다.

## 왜 중요한가

AI의 답변이 실제로 사용자의 문서에 근거한 것인지 확인할 수 있는 믿을 만한 방법을 제공해 위험한 환각을 줄여준다.

## 출처 및 참고 자료

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

최종 업데이트: 2026-09-29
