# Aleph Alpha、根拠のない回答を見抜くLLMを訓練

> 新たなMerlin‑Arthur訓練により、文書に答えがない場合にモデルが「分かりません」と言えるようにし、幻覚を最大35ポイント削減する。

Oossa · 2026-09-29 · https://oossa.com/ja/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alphaは、与えられた文書に必要な情報がない場合、言語モデルが回答を拒むよう学習させる手法を発表した。「Merlin‑Arthurプロトコル」と呼ばれるこの手法では、モデル（Arthur）が2つの補助役と対戦する。完全な文章を提示するMerlinと、決め手となる一文を取り除くMorganaだ。訓練中、Arthurはどちらを相手にしているか分からない。そのため、根拠がある場合にだけ回答し、それ以外は回答を控えるよう学ぶ。5つの質問応答ベンチマークでのテストでは、誤答が最大35ポイント減少し、新たな「grounding score（根拠づけスコア）」は最大0.38上昇した。

## 事実

- 論文はarXivに2512.11614として掲載（2026年8月8日）
- 誤答は最大35ポイント減少し、grounding scoreは最大0.38向上

## なぜ重要か

AIの回答が本当にユーザー自身の文書に基づいているかを確かめる手段となり、リスクの高い幻覚を減らせる。

## 出典と参考資料

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

最終更新: 2026-09-29
