# Aleph Alpha entraîne un LLM à signaler les réponses non étayées

> Un nouvel entraînement Merlin‑Arthur apprend au modèle à répondre « Je ne sais pas » quand un document ne contient pas la réponse, réduisant les hallucinations jusqu’à 35 points.

Oossa · 2026-09-29 · https://oossa.com/fr/aleph-alpha-trains-llm-to-flag-unsupported-answers

Aleph Alpha a dévoilé une méthode qui apprend à un modèle de langage à s’abstenir de répondre lorsque le document fourni ne contient pas les informations nécessaires. Baptisée protocole Merlin‑Arthur, cette technique oppose le modèle (Arthur) à deux assistants : Merlin, qui fournit un passage complet, et Morgana, qui en retire la phrase décisive. Pendant l’entraînement, Arthur ignore à qui il a affaire. Il apprend ainsi à répondre uniquement lorsque les éléments nécessaires sont présents et à s’abstenir dans le cas contraire. Des tests menés sur cinq références d’évaluation de questions-réponses montrent que les réponses erronées diminuent jusqu’à 35 points de pourcentage et qu’un nouveau « score d’ancrage » augmente jusqu’à 0,38.

## Les faits

- Article publié sur arXiv sous le numéro 2512.11614 (8 août 2026)
- Les réponses erronées ont diminué jusqu’à 35 points de pourcentage ; le score d’ancrage a progressé jusqu’à 0,38

## Pourquoi c'est important

Cette méthode permet aux utilisateurs de savoir de manière fiable si la réponse d’une IA provient réellement de leurs propres documents, réduisant ainsi les risques d’hallucinations.

## Sources et références

1. [Bounding Hallucinations: Merlin-Arthur Protocols for Mutual-Information Bounds in Language Models](https://www.aleph-alpha.com/en/blog/bounding-hallucinations-merlin-arthur-protocols-for-mutual-information-bounds-in-language-models/) – Aleph Alpha, 2026-09-29

Dernière mise à jour: 2026-09-29
