Aleph Alpha发布了一种训练方法,让语言模型在给定文档缺少必要信息时拒绝作答。这项名为Merlin‑Arthur协议的技术,让模型(Arthur)与两位助手展开较量:Merlin提供完整段落,Morgana则删去关键句。训练过程中,Arthur始终不知道自己面对的是哪一方,因此学会只在证据充分时作答,否则就弃答。在五项问答基准测试中,错误答案最多减少35个百分点,一项新的“依据支撑度评分”最高提升0.38。
为什么重要
这让用户能够可靠判断AI的答案是否确实来自自己的文档,从而减少可能造成风险的幻觉。