# Aleph Alpha addestra un LLM a segnalare le risposte non supportate

> Un nuovo addestramento Merlin‑Arthur insegna al modello a dire «non lo so» quando il documento non contiene la risposta, riducendo le allucinazioni fino a 35 punti percentuali.

Oossa · 2026-09-29 · https://oossa.com/it/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha ha presentato un metodo per insegnare a un modello linguistico a non rispondere quando il documento fornito non contiene le informazioni necessarie. La tecnica, chiamata protocollo Merlin‑Arthur, mette il modello (Arthur) alla prova con due assistenti: Merlin, che fornisce un passaggio completo, e Morgana, che elimina la frase decisiva. Durante l’addestramento Arthur non sa mai quale dei due ha davanti: impara così a rispondere solo quando sono disponibili prove e ad astenersi in caso contrario. I test condotti su cinque benchmark di domande e risposte mostrano che le risposte errate diminuiscono fino a 35 punti percentuali e che un nuovo «punteggio di ancoraggio» aumenta fino a 0,38.

## I fatti

- Articolo pubblicato su arXiv con il numero 2512.11614 (8 agosto 2026)
- Le risposte errate sono diminuite fino a 35 punti percentuali; il punteggio di ancoraggio è migliorato fino a 0,38

## Perché conta

Offre agli utenti un modo affidabile per capire se una risposta dell’IA proviene davvero dai loro documenti, riducendo il rischio di allucinazioni.

## Fonti e riferimenti

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

Ultimo aggiornamento: 2026-09-29
