Oossa

Aleph Alpha tränar LLM att flagga svar utan stöd

Den nya Merlin‑Arthur-träningen gör att en modell kan säga ”Jag vet inte” när svaret inte finns i ett dokument, och minskar hallucinationerna med upp till 35 procentenheter.

NotisOossa1 min läsning

Aleph Alpha har lanserat en metod som lär en språkmodell att avstå från att svara när det tillhandahållna dokumentet saknar den information som behövs. Tekniken, som kallas Merlin‑Arthur-protokollet, ställer modellen (Arthur) mot två medhjälpare: Merlin, som tillhandahåller ett fullständigt textavsnitt, och Morgana, som tar bort den avgörande meningen. Under träningen vet Arthur aldrig vilken av dem modellen möter. Därför lär den sig att bara svara när det finns belägg och annars avstå. Tester på fem QA-benchmarkar visar att antalet felaktiga svar minskar med upp till 35 procentenheter och att ett nytt ”förankringsmått” ökar med upp till 0,38.

Varför det spelar roll

Det ger användarna ett tillförlitligt sätt att avgöra när ett AI-svar faktiskt bygger på deras egna dokument och minskar risken för skadliga hallucinationer.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.

Källor och referenser

1 källor

Senast uppdaterad: ·Markdown·llms.txt