# Aleph Alpha обучила LLM распознавать ответы без подтверждения

> Новый протокол обучения Merlin–Arthur позволяет модели отвечать «Я не знаю», если в документе нет нужной информации, сокращая число галлюцинаций на величину до 35 процентных пунктов.

Oossa · 2026-09-29 · https://oossa.com/ru/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha представила метод, который учит языковую модель отказываться от ответа, если в предоставленном документе нет нужной информации. Этот метод, названный протоколом Merlin–Arthur, сталкивает модель (Артура) с двумя помощниками: Мерлином, который предоставляет полный фрагмент текста, и Морганой, которая удаляет ключевое предложение. Во время обучения Артур не знает, с кем из них имеет дело, и поэтому учится отвечать только при наличии подтверждений, а в остальных случаях воздерживаться от ответа. Тесты на пяти наборах данных для оценки ответов на вопросы показали, что число неверных ответов сокращается на величину до 35 процентных пунктов, а новый показатель «обоснованности» растёт на величину до 0,38.

## Факты

- Статья опубликована на arXiv под номером 2512.11614 (8 августа 2026 года)
- Число неверных ответов сократилось на величину до 35 процентных пунктов; показатель обоснованности вырос на величину до 0,38

## Почему это важно

Метод помогает пользователям понять, действительно ли ответ ИИ основан на их документах, и снижает риск опасных галлюцинаций.

## Источники и ссылки

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

Обновлено: 2026-09-29
