# Aleph Alpha entrena un LLM para detectar respuestas sin fundamento

> El nuevo entrenamiento Merlin‑Arthur permite que un modelo diga «No lo sé» cuando un documento no contiene la respuesta y reduce las alucinaciones hasta en 35 puntos.

Oossa · 2026-09-29 · https://oossa.com/es/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha publicó un método que enseña a un modelo de lenguaje a no responder cuando el documento proporcionado no contiene la información necesaria. La técnica, llamada protocolo Merlin‑Arthur, enfrenta al modelo (Arthur) con dos ayudantes: Merlin, que proporciona un pasaje completo, y Morgana, que elimina la frase decisiva. Durante el entrenamiento, Arthur nunca sabe a qué lado se enfrenta, así que aprende a responder solo cuando hay pruebas y a abstenerse en caso contrario. Las pruebas en cinco benchmarks de preguntas y respuestas muestran que las respuestas incorrectas disminuyen hasta en 35 puntos porcentuales y que una nueva «puntuación de fundamentación» aumenta hasta 0,38.

## Los hechos

- El artículo se publicó en arXiv con el número 2512.11614 (8 de agosto de 2026)
- Las respuestas incorrectas disminuyeron hasta en 35 puntos porcentuales; la puntuación de fundamentación mejoró hasta en 0,38

## Por qué importa

Ofrece a los usuarios una forma fiable de saber cuándo una respuesta de la IA realmente se basa en sus propios documentos y reduce las alucinaciones que pueden entrañar riesgos.

## Fuentes y referencias

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

Última actualización: 2026-09-29
