Oossa

Aleph Alpha обучила LLM распознавать ответы без подтверждения

Новый протокол обучения Merlin–Arthur позволяет модели отвечать «Я не знаю», если в документе нет нужной информации, сокращая число галлюцинаций на величину до 35 процентных пунктов.

ЗаметкаOossa1 мин чтения

Aleph Alpha представила метод, который учит языковую модель отказываться от ответа, если в предоставленном документе нет нужной информации. Этот метод, названный протоколом Merlin–Arthur, сталкивает модель (Артура) с двумя помощниками: Мерлином, который предоставляет полный фрагмент текста, и Морганой, которая удаляет ключевое предложение. Во время обучения Артур не знает, с кем из них имеет дело, и поэтому учится отвечать только при наличии подтверждений, а в остальных случаях воздерживаться от ответа. Тесты на пяти наборах данных для оценки ответов на вопросы показали, что число неверных ответов сокращается на величину до 35 процентных пунктов, а новый показатель «обоснованности» растёт на величину до 0,38.

Почему это важно

Метод помогает пользователям понять, действительно ли ответ ИИ основан на их документах, и снижает риск опасных галлюцинаций.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models ↗Aleph Alpha29 сент. 2026 г.

1 источников

Обновлено: ·Markdown·llms.txt