Oossa

Aleph Alpha trainiert LLMs darauf, unbelegte Antworten zu erkennen

Ein neues Merlin-Arthur-Trainingsverfahren bringt einem Modell bei, mit „Ich weiß es nicht“ zu antworten, wenn ein Dokument die gesuchte Information nicht enthält. So lassen sich Halluzinationen um bis zu 35 Prozentpunkte verringern.

KurzmeldungOossa1 Min. Lesezeit

Aleph Alpha hat ein Verfahren vorgestellt, das einem Sprachmodell beibringt, nicht zu antworten, wenn das bereitgestellte Dokument die nötigen Informationen nicht enthält. Bei der sogenannten Merlin-Arthur-Methode tritt das Modell (Arthur) gegen zwei Helfer an: Merlin liefert eine vollständige Passage, während Morgana den entscheidenden Satz entfernt. Während des Trainings weiß Arthur nie, mit welcher Seite er es zu tun hat. Dadurch lernt er, nur dann zu antworten, wenn Belege vorliegen, und sich andernfalls einer Antwort zu enthalten. Tests mit fünf QA-Benchmarks zeigen, dass die Zahl falscher Antworten um bis zu 35 Prozentpunkte sinkt und ein neuer „Grounding Score“ um bis zu 0,38 steigt.

Warum es wichtig ist

Das Verfahren bietet Nutzern eine verlässliche Möglichkeit zu erkennen, ob eine KI-Antwort tatsächlich aus ihren eigenen Dokumenten stammt, und verringert so das Risiko schädlicher Halluzinationen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.

Quellen und Referenzen

1 Quellen

Zuletzt aktualisiert: ·Markdown·llms.txt