Aleph Alpha ha presentato un metodo per insegnare a un modello linguistico a non rispondere quando il documento fornito non contiene le informazioni necessarie. La tecnica, chiamata protocollo Merlin‑Arthur, mette il modello (Arthur) alla prova con due assistenti: Merlin, che fornisce un passaggio completo, e Morgana, che elimina la frase decisiva. Durante l’addestramento Arthur non sa mai quale dei due ha davanti: impara così a rispondere solo quando sono disponibili prove e ad astenersi in caso contrario. I test condotti su cinque benchmark di domande e risposte mostrano che le risposte errate diminuiscono fino a 35 punti percentuali e che un nuovo «punteggio di ancoraggio» aumenta fino a 0,38.
Perché conta
Offre agli utenti un modo affidabile per capire se una risposta dell’IA proviene davvero dai loro documenti, riducendo il rischio di allucinazioni.