研究人员发现,大语言模型会以几何方式编码答案是否正确的线索。通过考察模型隐藏状态从错误答案到正确答案的平均变化,他们得以构造一个评分向量,无须微调就能为候选答案排序。在对5款参数量从1 billion到8 billion的模型进行测试后,这项技术在ARC‑Challenge和MMLU上的表现比常用的零样本对数概率方法最高提升32个百分点,在TruthfulQA上则最高提升52个百分点。
方法原理
研究作者选取50个带标签的示例输入模型,收集网络中段的隐藏表示,再计算一个均值向量,用来表示隐藏状态从错误答案转向正确答案的方向。推理时,每个候选答案只需经过一次前向传播,并与该向量进行一次点积运算。整个过程不会生成答案文本,也不会更改模型参数。
对模型可靠性的影响
将这一几何方向用于检测幻觉时,AUROC达到0.693,高于标准概率评分的0.578。研究还显示,事实推理、领域知识和真实性相关的正确性线索分别处于几乎正交的子空间中,这意味着模型会为不同类型的正确性保留相互独立的信号。这或许能解释为什么模型常常在内部“知道”正确答案,却未能将其输出。
为什么重要
对日常用户而言,这项技术有望让聊天机器人给出更可信的答案,尤其是在回答事实性问题时。它也提供了一种计算成本较低的潜在幻觉识别方法。不过,该方法仍需访问模型隐藏状态,而大多数公开API并不提供这类数据。