Aleph Alpha가 제공된 문서에 필요한 정보가 없을 때 언어 모델이 답변을 거부하도록 훈련하는 방법을 공개했다. Merlin‑Arthur 프로토콜이라 불리는 이 기법은 모델(Arthur)이 두 조력자와 대결하는 방식이다. 전체 문단을 제공하는 Merlin과 결정적인 문장을 삭제하는 Morgana가 조력자로 나선다. 훈련 중 Arthur는 어느 쪽을 상대하는지 알 수 없기 때문에, 근거가 있을 때만 답하고 그렇지 않으면 답변을 유보하는 법을 배운다. 5개 QA 벤치마크에서 오답은 최대 35%포인트 줄었고, 새로운 ‘근거성 점수’는 최대 0.38 상승했다.
왜 중요한가
AI의 답변이 실제로 사용자의 문서에 근거한 것인지 확인할 수 있는 믿을 만한 방법을 제공해 위험한 환각을 줄여준다.