# 幾何学的スコアリングで言語モデルの正答率が向上

> 新手法は、モデルの隠れ状態から答えを順位づける方向を見つけ、標準的な確率スコアリングを最大52ポイント上回る。

Oossa · 2026-10-06 · https://oossa.com/ja/geometric-scoring-boosts-answer-correctness-in-language-models

研究者らは、大規模言語モデルが回答の正誤を示す幾何学的な手がかりを内部に保持していることを発見した。誤答から正答へ移る際の隠れ状態の平均的な変化を調べることで、ファインチューニングを行わずに候補を順位づけるスコアリング用ベクトルを作成できる。パラメーター数が1 billionから8 billionまでの5つのモデルで検証したところ、この手法は通常のゼロショット対数確率アプローチを、ARC‑ChallengeとMMLUで最大32ポイント、TruthfulQAで最大52ポイント上回った。

## 手法の仕組み

著者らはラベル付きの例を50件用意し、モデルに入力してネットワークのほぼ中間にある隠れ表現を集める。そして、誤答の状態から正答の状態へ向かう平均ベクトルを算出する。推論時には、各回答候補について必要なのはフォワードパス1回と、このベクトルとの内積計算だけだ。回答文は生成せず、モデルのパラメーターも変更しない。

## モデルの信頼性への影響

幻覚検出器として使うと、この幾何学的な方向はAUROC 0.693を達成し、標準的な確率スコアリングの0.578を上回る。また、事実に基づく推論、分野知識、真実性に関する正しさの手がかりは、互いにほぼ直交する部分空間に存在することも示された。つまり、モデルは正しさの種類ごとに別々の信号を保持している。これは、モデルが内部では正解を把握しているのに、出力に失敗することが多い理由を説明する可能性がある。

## 事実

- この手法は、ARC‑ChallengeとMMLUでゼロショットスコアリングを最大+32.0ポイント改善する。
- TruthfulQAでは、改善幅は+38.1から+51.8ポイントに及ぶ。
- Llama、Qwen、Gemmaの3つの系列から、パラメーター数が1 Bから8 Bまでの5モデルを検証した。
- 必要なラベル付き例は50件のみで、パラメーターの更新は行わない。
- 幻覚検出器として使った場合、対数確率スコアリングの0.578に対し、AUROC 0.693を達成する。

## なぜ重要か

一般のユーザーにとって、この手法はチャットボットの回答、特に事実に関する質問への回答をより信頼できるものにする可能性がある。また、計算コストをかけずに幻覚の可能性を検出する方法にもなり得る。ただし、利用にはモデルの隠れ状態へのアクセスが必要で、多くの公開APIではそれが提供されていない。

## 出典と参考資料

1. [Correctness Is a Direction: Geometric Answer Selection in Language Models](https://arxiv.org/abs/2610.04512) – arXiv, 2026-10-06

最終更新: 2026-10-06
