# Aleph Alpha traint LLM om ongefundeerde antwoorden te signaleren

> Met de nieuwe Merlin-Arthur-training leert een model ‘Ik weet het niet’ te zeggen als het antwoord niet in een document staat. Zo daalt het aantal hallucinaties met maximaal 35 procentpunt.

Oossa · 2026-09-29 · https://oossa.com/nl/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha heeft een methode uitgebracht die een taalmodel leert geen antwoord te geven wanneer de benodigde informatie ontbreekt in het aangeleverde document. De techniek, het Merlin-Arthur-protocol, zet het model (Arthur) tegenover twee helpers: Merlin, die een volledige passage aanlevert, en Morgana, die de beslissende zin verwijdert. Tijdens de training weet Arthur nooit met welke van de twee hij te maken heeft. Zo leert hij alleen te antwoorden als het bewijs aanwezig is, en zich anders te onthouden. Tests op vijf QA-benchmarks laten zien dat het aantal foute antwoorden met maximaal 35 procentpunt daalt en een nieuwe ‘grounding score’ met maximaal 0,38 stijgt.

## De feiten

- Artikel gepubliceerd op arXiv als 2512.11614 (8 augustus 2026)
- Het aantal foute antwoorden daalde met maximaal 35 procentpunt; de grounding score steeg met maximaal 0,38

## Waarom het ertoe doet

Gebruikers krijgen zo een betrouwbare manier om te weten of een AI-antwoord echt afkomstig is uit hun eigen documenten, waardoor het risico op schadelijke hallucinaties afneemt.

## Bronnen en referenties

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

Laatst bijgewerkt: 2026-09-29
