Oossa

Aleph Alpha, 근거 없는 답변 걸러내는 LLM 훈련법 공개

새로운 Merlin‑Arthur 훈련 방식은 문서에 답이 없을 때 모델이 “모르겠습니다”라고 답하게 해 환각을 최대 35%포인트 줄인다.

짧은 소식Oossa1 분 읽기

Aleph Alpha가 제공된 문서에 필요한 정보가 없을 때 언어 모델이 답변을 거부하도록 훈련하는 방법을 공개했다. Merlin‑Arthur 프로토콜이라 불리는 이 기법은 모델(Arthur)이 두 조력자와 대결하는 방식이다. 전체 문단을 제공하는 Merlin과 결정적인 문장을 삭제하는 Morgana가 조력자로 나선다. 훈련 중 Arthur는 어느 쪽을 상대하는지 알 수 없기 때문에, 근거가 있을 때만 답하고 그렇지 않으면 답변을 유보하는 법을 배운다. 5개 QA 벤치마크에서 오답은 최대 35%포인트 줄었고, 새로운 ‘근거성 점수’는 최대 0.38 상승했다.

왜 중요한가

AI의 답변이 실제로 사용자의 문서에 근거한 것인지 확인할 수 있는 믿을 만한 방법을 제공해 위험한 환각을 줄여준다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.

출처 및 참고 자료

1 개 출처

최종 업데이트: ·Markdown·llms.txt