A Aleph Alpha lançou um método que ensina um modelo de linguagem a se recusar a responder quando o documento fornecido não contém as informações necessárias. A técnica, chamada protocolo Merlin-Arthur, coloca o modelo (Arthur) diante de dois auxiliares: Merlin, que fornece um trecho completo, e Morgana, que remove a frase decisiva. Durante o treinamento, Arthur nunca sabe com qual dos dois está lidando. Assim, aprende a responder apenas quando há evidências e a se abster nos demais casos. Testes em cinco benchmarks de perguntas e respostas mostram que as respostas erradas caem em até 35 pontos percentuais e que uma nova “pontuação de fundamentação” aumenta em até 0,38.
Por que importa
O método oferece aos usuários uma forma confiável de saber quando uma resposta da IA realmente se baseia nos próprios documentos, reduzindo alucinações potencialmente arriscadas.