Oossa

Aleph Alpha entrena un LLM para detectar respuestas sin fundamento

El nuevo entrenamiento Merlin‑Arthur permite que un modelo diga «No lo sé» cuando un documento no contiene la respuesta y reduce las alucinaciones hasta en 35 puntos.

BreveOossa1 min de lectura

Aleph Alpha publicó un método que enseña a un modelo de lenguaje a no responder cuando el documento proporcionado no contiene la información necesaria. La técnica, llamada protocolo Merlin‑Arthur, enfrenta al modelo (Arthur) con dos ayudantes: Merlin, que proporciona un pasaje completo, y Morgana, que elimina la frase decisiva. Durante el entrenamiento, Arthur nunca sabe a qué lado se enfrenta, así que aprende a responder solo cuando hay pruebas y a abstenerse en caso contrario. Las pruebas en cinco benchmarks de preguntas y respuestas muestran que las respuestas incorrectas disminuyen hasta en 35 puntos porcentuales y que una nueva «puntuación de fundamentación» aumenta hasta 0,38.

Por qué importa

Ofrece a los usuarios una forma fiable de saber cuándo una respuesta de la IA realmente se basa en sus propios documentos y reduce las alucinaciones que pueden entrañar riesgos.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.

Fuentes y referencias

1 fuentes

Última actualización: ·Markdown·llms.txt