# Aleph Alpha treina LLM para identificar respostas sem respaldo

> Novo treinamento Merlin-Arthur ensina o modelo a dizer “não sei” quando o documento não contém a resposta, reduzindo alucinações em até 35 pontos percentuais.

Oossa · 2026-09-29 · https://oossa.com/pt/aleph-alpha-trains-llm-to-flag-unsupported-answers

A Aleph Alpha lançou um método que ensina um modelo de linguagem a se recusar a responder quando o documento fornecido não contém as informações necessárias. A técnica, chamada protocolo Merlin-Arthur, coloca o modelo (Arthur) diante de dois auxiliares: Merlin, que fornece um trecho completo, e Morgana, que remove a frase decisiva. Durante o treinamento, Arthur nunca sabe com qual dos dois está lidando. Assim, aprende a responder apenas quando há evidências e a se abster nos demais casos. Testes em cinco benchmarks de perguntas e respostas mostram que as respostas erradas caem em até 35 pontos percentuais e que uma nova “pontuação de fundamentação” aumenta em até 0,38.

## Os fatos

- Artigo publicado no arXiv sob o número 2512.11614 (8 de agosto de 2026)
- As respostas erradas caíram até 35 pontos percentuais; a pontuação de fundamentação melhorou em até 0,38

## Por que importa

O método oferece aos usuários uma forma confiável de saber quando uma resposta da IA realmente se baseia nos próprios documentos, reduzindo alucinações potencialmente arriscadas.

## Fontes e referências

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

Última atualização: 2026-09-29
