Aleph Alpha hat ein Verfahren vorgestellt, das einem Sprachmodell beibringt, nicht zu antworten, wenn das bereitgestellte Dokument die nötigen Informationen nicht enthält. Bei der sogenannten Merlin-Arthur-Methode tritt das Modell (Arthur) gegen zwei Helfer an: Merlin liefert eine vollständige Passage, während Morgana den entscheidenden Satz entfernt. Während des Trainings weiß Arthur nie, mit welcher Seite er es zu tun hat. Dadurch lernt er, nur dann zu antworten, wenn Belege vorliegen, und sich andernfalls einer Antwort zu enthalten. Tests mit fünf QA-Benchmarks zeigen, dass die Zahl falscher Antworten um bis zu 35 Prozentpunkte sinkt und ein neuer „Grounding Score“ um bis zu 0,38 steigt.
Warum es wichtig ist
Das Verfahren bietet Nutzern eine verlässliche Möglichkeit zu erkennen, ob eine KI-Antwort tatsächlich aus ihren eigenen Dokumenten stammt, und verringert so das Risiko schädlicher Halluzinationen.