Aleph Alpha publicó un método que enseña a un modelo de lenguaje a no responder cuando el documento proporcionado no contiene la información necesaria. La técnica, llamada protocolo Merlin‑Arthur, enfrenta al modelo (Arthur) con dos ayudantes: Merlin, que proporciona un pasaje completo, y Morgana, que elimina la frase decisiva. Durante el entrenamiento, Arthur nunca sabe a qué lado se enfrenta, así que aprende a responder solo cuando hay pruebas y a abstenerse en caso contrario. Las pruebas en cinco benchmarks de preguntas y respuestas muestran que las respuestas incorrectas disminuyen hasta en 35 puntos porcentuales y que una nueva «puntuación de fundamentación» aumenta hasta 0,38.
Por qué importa
Ofrece a los usuarios una forma fiable de saber cuándo una respuesta de la IA realmente se basa en sus propios documentos y reduce las alucinaciones que pueden entrañar riesgos.