# 기하학적 점수화로 언어 모델 답변 정확도 높인다

> 새 기법은 모델의 은닉 상태에서 답변 순위를 매기는 방향을 찾아, 표준 확률 점수화보다 최대 52포인트 더 정확하게 평가한다.

Oossa · 2026-10-06 · https://oossa.com/ko/geometric-scoring-boosts-answer-correctness-in-language-models

연구진은 대형 언어 모델이 답변의 정오를 가늠하는 기하학적 단서를 저장하고 있다는 사실을 발견했다. 오답에서 정답으로 바뀔 때 은닉 상태가 평균적으로 어떻게 달라지는지 살펴보면, 미세 조정 없이도 후보 답변의 순위를 매기는 점수화 벡터를 만들 수 있다. 1 billion~8 billion 매개변수 규모의 모델 5종으로 실험한 결과, 이 기법은 일반적인 제로샷 로그 확률 접근법보다 ARC‑Challenge와 MMLU에서 최대 32포인트, TruthfulQA에서 최대 52포인트 높은 성능을 보였다.

## 기법의 작동 방식

저자들은 라벨이 붙은 예시 50개를 모델에 입력해 네트워크 중간쯤에 있는 은닉 표현을 수집한 뒤, 오답 상태에서 정답 상태를 향하는 평균 벡터를 계산한다. 추론 시에는 각 후보 답변에 대해 순전파 한 번과 이 벡터와의 내적 한 번만 수행하면 된다. 답변 문장을 생성하지 않으며 모델 매개변수도 바꾸지 않는다.

## 모델 신뢰성에 미치는 영향

환각 탐지기로 사용했을 때 이 기하학적 방향은 AUROC 0.693을 기록해, 표준 확률 점수화의 0.578보다 높았다. 연구에 따르면 사실 추론, 분야 지식, 진실성에 관한 정답 단서는 서로 거의 직교하는 부분공간에 놓여 있다. 즉 모델은 정답 여부의 종류에 따라 서로 다른 신호를 유지한다. 이는 모델이 내부적으로 정답을 알고도 답변으로 내놓지 못하는 경우가 잦은 이유를 설명할 수 있다.

## 팩트

- 이 기법은 ARC‑Challenge와 MMLU에서 제로샷 점수화 성능을 최대 +32.0%포인트 높인다.
- TruthfulQA에서 향상 폭은 +38.1~+51.8%포인트다.
- Llama, Qwen, Gemma 등 3개 계열의 모델 5종을 대상으로 실험했으며, 매개변수 규모는 1 B~8 B다.
- 라벨이 붙은 예시 50개만 필요하며, 매개변수 업데이트는 수행하지 않는다.
- 환각 탐지기로 사용하면 AUROC 0.693을 기록해 로그 확률 점수화의 0.578보다 높다.

## 왜 중요한가

일반 사용자에게 이 기법은 특히 사실을 묻는 질문에서 챗봇이 더 신뢰할 만한 답변을 내놓도록 하는 데 도움이 될 수 있다. 계산 비용을 크게 들이지 않고 환각 가능성이 높은 답변을 가려내는 방법도 제시한다. 다만 이 접근법을 사용하려면 모델의 은닉 상태에 접근해야 하며, 대부분의 공개 API는 이를 제공하지 않는다.

## 출처 및 참고 자료

1. [Correctness Is a Direction: Geometric Answer Selection in Language Models](https://arxiv.org/abs/2610.04512) – arXiv, 2026-10-06

최종 업데이트: 2026-10-06
