Des chercheurs ont découvert que les grands modèles de langage contiennent un indice géométrique permettant de déterminer si une réponse est correcte. En observant le déplacement moyen des états cachés entre les réponses erronées et les bonnes réponses, ils peuvent créer un vecteur de score qui classe les réponses possibles sans aucun réglage fin. Testée sur cinq modèles comptant de 1 milliard à 8 milliards de paramètres, la technique surpasse l’approche habituelle de score par log-probabilité en zéro-shot de jusqu’à 32 points sur ARC‑Challenge et MMLU, et de jusqu’à 52 points sur TruthfulQA.
Fonctionnement de la méthode
Les auteurs prennent cinquante exemples étiquetés, les soumettent au modèle pour recueillir des représentations cachées à peu près à mi-parcours du réseau, puis calculent le vecteur moyen qui va des états associés aux mauvaises réponses à ceux associés aux bonnes. Au moment de l’inférence, chaque réponse possible nécessite un seul passage dans le modèle et un simple produit scalaire avec ce vecteur. Aucun texte de réponse n’est généré et les paramètres du modèle ne sont pas modifiés.
Conséquences pour la fiabilité des modèles
Utilisée pour détecter les hallucinations, cette direction géométrique atteint un AUROC de 0,693, contre 0,578 pour le score de probabilité standard. L’étude montre également que les indices de justesse liés au raisonnement factuel, aux connaissances spécialisées et à la véracité occupent des sous-espaces presque orthogonaux : les modèles conservent donc des signaux distincts selon le type de réponse à évaluer. Cela pourrait expliquer pourquoi les modèles connaissent souvent la bonne réponse en interne, mais ne la donnent pas.
Pourquoi c'est important
Pour les utilisateurs au quotidien, cette technique pourrait rendre les réponses des chatbots plus fiables, notamment aux questions factuelles. Elle pourrait aussi permettre de repérer les hallucinations probables sans calculs coûteux. Toutefois, elle nécessite toujours d’accéder aux états cachés du modèle, auxquels la plupart des API publiques ne donnent pas accès.