Oossa

기하학적 점수화로 언어 모델 답변 정확도 높인다

새 기법은 모델의 은닉 상태에서 답변 순위를 매기는 방향을 찾아, 표준 확률 점수화보다 최대 52포인트 더 정확하게 평가한다.

작성: Oossa 게시일: 1 분 읽기

Domenico Loia · Unsplash

연구진은 대형 언어 모델이 답변의 정오를 가늠하는 기하학적 단서를 저장하고 있다는 사실을 발견했다. 오답에서 정답으로 바뀔 때 은닉 상태가 평균적으로 어떻게 달라지는지 살펴보면, 미세 조정 없이도 후보 답변의 순위를 매기는 점수화 벡터를 만들 수 있다. 1 billion~8 billion 매개변수 규모의 모델 5종으로 실험한 결과, 이 기법은 일반적인 제로샷 로그 확률 접근법보다 ARC‑Challenge와 MMLU에서 최대 32포인트, TruthfulQA에서 최대 52포인트 높은 성능을 보였다.

기법의 작동 방식

저자들은 라벨이 붙은 예시 50개를 모델에 입력해 네트워크 중간쯤에 있는 은닉 표현을 수집한 뒤, 오답 상태에서 정답 상태를 향하는 평균 벡터를 계산한다. 추론 시에는 각 후보 답변에 대해 순전파 한 번과 이 벡터와의 내적 한 번만 수행하면 된다. 답변 문장을 생성하지 않으며 모델 매개변수도 바꾸지 않는다.

모델 신뢰성에 미치는 영향

환각 탐지기로 사용했을 때 이 기하학적 방향은 AUROC 0.693을 기록해, 표준 확률 점수화의 0.578보다 높았다. 연구에 따르면 사실 추론, 분야 지식, 진실성에 관한 정답 단서는 서로 거의 직교하는 부분공간에 놓여 있다. 즉 모델은 정답 여부의 종류에 따라 서로 다른 신호를 유지한다. 이는 모델이 내부적으로 정답을 알고도 답변으로 내놓지 못하는 경우가 잦은 이유를 설명할 수 있다.

왜 중요한가

일반 사용자에게 이 기법은 특히 사실을 묻는 질문에서 챗봇이 더 신뢰할 만한 답변을 내놓도록 하는 데 도움이 될 수 있다. 계산 비용을 크게 들이지 않고 환각 가능성이 높은 답변을 가려내는 방법도 제시한다. 다만 이 접근법을 사용하려면 모델의 은닉 상태에 접근해야 하며, 대부분의 공개 API는 이를 제공하지 않는다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.