Aleph Alphaは、与えられた文書に必要な情報がない場合、言語モデルが回答を拒むよう学習させる手法を発表した。「Merlin‑Arthurプロトコル」と呼ばれるこの手法では、モデル(Arthur)が2つの補助役と対戦する。完全な文章を提示するMerlinと、決め手となる一文を取り除くMorganaだ。訓練中、Arthurはどちらを相手にしているか分からない。そのため、根拠がある場合にだけ回答し、それ以外は回答を控えるよう学ぶ。5つの質問応答ベンチマークでのテストでは、誤答が最大35ポイント減少し、新たな「grounding score(根拠づけスコア)」は最大0.38上昇した。
なぜ重要か
AIの回答が本当にユーザー自身の文書に基づいているかを確かめる手段となり、リスクの高い幻覚を減らせる。