Aleph Alpha a dévoilé une méthode qui apprend à un modèle de langage à s’abstenir de répondre lorsque le document fourni ne contient pas les informations nécessaires. Baptisée protocole Merlin‑Arthur, cette technique oppose le modèle (Arthur) à deux assistants : Merlin, qui fournit un passage complet, et Morgana, qui en retire la phrase décisive. Pendant l’entraînement, Arthur ignore à qui il a affaire. Il apprend ainsi à répondre uniquement lorsque les éléments nécessaires sont présents et à s’abstenir dans le cas contraire. Des tests menés sur cinq références d’évaluation de questions-réponses montrent que les réponses erronées diminuent jusqu’à 35 points de pourcentage et qu’un nouveau « score d’ancrage » augmente jusqu’à 0,38.
Pourquoi c'est important
Cette méthode permet aux utilisateurs de savoir de manière fiable si la réponse d’une IA provient réellement de leurs propres documents, réduisant ainsi les risques d’hallucinations.