研究者らは、大規模言語モデルが回答の正誤を示す幾何学的な手がかりを内部に保持していることを発見した。誤答から正答へ移る際の隠れ状態の平均的な変化を調べることで、ファインチューニングを行わずに候補を順位づけるスコアリング用ベクトルを作成できる。パラメーター数が1 billionから8 billionまでの5つのモデルで検証したところ、この手法は通常のゼロショット対数確率アプローチを、ARC‑ChallengeとMMLUで最大32ポイント、TruthfulQAで最大52ポイント上回った。
手法の仕組み
著者らはラベル付きの例を50件用意し、モデルに入力してネットワークのほぼ中間にある隠れ表現を集める。そして、誤答の状態から正答の状態へ向かう平均ベクトルを算出する。推論時には、各回答候補について必要なのはフォワードパス1回と、このベクトルとの内積計算だけだ。回答文は生成せず、モデルのパラメーターも変更しない。
モデルの信頼性への影響
幻覚検出器として使うと、この幾何学的な方向はAUROC 0.693を達成し、標準的な確率スコアリングの0.578を上回る。また、事実に基づく推論、分野知識、真実性に関する正しさの手がかりは、互いにほぼ直交する部分空間に存在することも示された。つまり、モデルは正しさの種類ごとに別々の信号を保持している。これは、モデルが内部では正解を把握しているのに、出力に失敗することが多い理由を説明する可能性がある。
なぜ重要か
一般のユーザーにとって、この手法はチャットボットの回答、特に事実に関する質問への回答をより信頼できるものにする可能性がある。また、計算コストをかけずに幻覚の可能性を検出する方法にもなり得る。ただし、利用にはモデルの隠れ状態へのアクセスが必要で、多くの公開APIではそれが提供されていない。