# Aleph Alpha tränar LLM att flagga svar utan stöd

> Den nya Merlin‑Arthur-träningen gör att en modell kan säga ”Jag vet inte” när svaret inte finns i ett dokument, och minskar hallucinationerna med upp till 35 procentenheter.

Oossa · 2026-09-29 · https://oossa.com/sv/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha har lanserat en metod som lär en språkmodell att avstå från att svara när det tillhandahållna dokumentet saknar den information som behövs. Tekniken, som kallas Merlin‑Arthur-protokollet, ställer modellen (Arthur) mot två medhjälpare: Merlin, som tillhandahåller ett fullständigt textavsnitt, och Morgana, som tar bort den avgörande meningen. Under träningen vet Arthur aldrig vilken av dem modellen möter. Därför lär den sig att bara svara när det finns belägg och annars avstå. Tester på fem QA-benchmarkar visar att antalet felaktiga svar minskar med upp till 35 procentenheter och att ett nytt ”förankringsmått” ökar med upp till 0,38.

## Fakta

- Uppsatsen publicerades på arXiv som 2512.11614 (8 augusti 2026)
- Antalet felaktiga svar minskade med upp till 35 procentenheter; förankringsmåttet förbättrades med upp till 0,38

## Varför det spelar roll

Det ger användarna ett tillförlitligt sätt att avgöra när ett AI-svar faktiskt bygger på deras egna dokument och minskar risken för skadliga hallucinationer.

## Källor och referenser

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

Senast uppdaterad: 2026-09-29
