# Aleph Alpha训练大模型识别缺乏依据的答案

> 全新的Merlin‑Arthur训练方法，让模型在文档未提供答案时说“我不知道”，最多可将幻觉减少35个百分点。

Oossa · 2026-09-29 · https://oossa.com/zh/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha发布了一种训练方法，让语言模型在给定文档缺少必要信息时拒绝作答。这项名为Merlin‑Arthur协议的技术，让模型（Arthur）与两位助手展开较量：Merlin提供完整段落，Morgana则删去关键句。训练过程中，Arthur始终不知道自己面对的是哪一方，因此学会只在证据充分时作答，否则就弃答。在五项问答基准测试中，错误答案最多减少35个百分点，一项新的“依据支撑度评分”最高提升0.38。

## 事实

- 论文于2026年8月8日发布在arXiv，编号为2512.11614
- 错误答案最多减少35个百分点；依据支撑度评分最高提升0.38

## 为什么重要

这让用户能够可靠判断AI的答案是否确实来自自己的文档，从而减少可能造成风险的幻觉。

## 来源与参考

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

最后更新: 2026-09-29
