Aleph Alpha представила метод, который учит языковую модель отказываться от ответа, если в предоставленном документе нет нужной информации. Этот метод, названный протоколом Merlin–Arthur, сталкивает модель (Артура) с двумя помощниками: Мерлином, который предоставляет полный фрагмент текста, и Морганой, которая удаляет ключевое предложение. Во время обучения Артур не знает, с кем из них имеет дело, и поэтому учится отвечать только при наличии подтверждений, а в остальных случаях воздерживаться от ответа. Тесты на пяти наборах данных для оценки ответов на вопросы показали, что число неверных ответов сокращается на величину до 35 процентных пунктов, а новый показатель «обоснованности» растёт на величину до 0,38.
Почему это важно
Метод помогает пользователям понять, действительно ли ответ ИИ основан на их документах, и снижает риск опасных галлюцинаций.