# Geometrisches Scoring verbessert die Antwortbewertung von Sprachmodellen

> Eine neue Methode findet in den verborgenen Zuständen von Modellen eine Richtung, die Antworten bis zu 52 Punkte besser bewertet als die übliche Wahrscheinlichkeitsbewertung.

Oossa · 2026-10-06 · https://oossa.com/de/geometric-scoring-boosts-answer-correctness-in-language-models

Forschende haben herausgefunden, dass große Sprachmodelle ein geometrisches Signal dafür speichern, ob eine Antwort richtig ist. Indem sie die durchschnittliche Verschiebung der verborgenen Zustände von falschen zu richtigen Antworten betrachten, können sie einen Bewertungsvektor erstellen, der mögliche Antworten ohne Feinabstimmung einordnet. In Tests mit fünf Modellen mit 1 Milliarde bis 8 Milliarden Parametern übertraf das Verfahren den üblichen Zero-Shot-Ansatz mit Log-Wahrscheinlichkeiten um bis zu 32 Punkte bei ARC-Challenge und MMLU sowie um bis zu 52 Punkte bei TruthfulQA.

## So funktioniert die Methode

Die Autorinnen und Autoren verwenden fünfzig gekennzeichnete Beispiele, lassen sie durch das Modell laufen, sammeln etwa auf halber Netzwerktiefe die verborgenen Repräsentationen und berechnen den mittleren Vektor, der von den Zuständen falscher zu denen richtiger Antworten weist. Bei der Inferenz benötigt jede mögliche Antwort nur einen Durchlauf durchs Modell und ein einziges Skalarprodukt mit diesem Vektor. Es wird kein Antworttext erzeugt und keine Modellparameter werden verändert.

## Was das für die Zuverlässigkeit von Modellen bedeutet

Als Halluzinationsdetektor erreicht die geometrische Richtung einen AUROC-Wert von 0.693, verglichen mit 0.578 bei der üblichen Wahrscheinlichkeitsbewertung. Die Studie zeigt außerdem, dass Signale für die Richtigkeit bei faktischem Schlussfolgern, Domänenwissen und Wahrheitsgehalt nahezu orthogonale Unterräume belegen. Das bedeutet, dass Modelle für unterschiedliche Arten von Richtigkeit getrennte Signale speichern. Dies könnte erklären, warum Modelle die richtige Antwort intern oft kennen, sie aber trotzdem nicht ausgeben.

## Die Fakten

- Die Methode verbessert die Zero-Shot-Bewertung bei ARC-Challenge und MMLU um bis zu +32.0 Prozentpunkte.
- Bei TruthfulQA beträgt der Zugewinn zwischen +38.1 und +51.8 Prozentpunkten.
- Getestet wurden fünf Modelle mit 1 B bis 8 B Parametern aus drei Modellfamilien: Llama, Qwen und Gemma.
- Es werden nur fünfzig gekennzeichnete Beispiele benötigt; die Parameter bleiben unverändert.
- Als Halluzinationsdetektor erreicht das Verfahren einen AUROC-Wert von 0.693 gegenüber 0.578 bei der Bewertung anhand von Log-Wahrscheinlichkeiten.

## Warum es wichtig ist

Für Nutzerinnen und Nutzer könnte das Verfahren zu verlässlicheren Antworten von Chatbots führen, insbesondere bei Faktenfragen. Außerdem deutet es auf eine Möglichkeit hin, wahrscheinliche Halluzinationen ohne hohen Rechenaufwand zu erkennen. Allerdings setzt das Verfahren weiterhin Zugriff auf verborgene Modellzustände voraus, die von den meisten öffentlichen APIs nicht offengelegt werden.

## Quellen und Referenzen

1. [Correctness Is a Direction: Geometric Answer Selection in Language Models](https://arxiv.org/abs/2610.04512) – arXiv, 2026-10-06

Zuletzt aktualisiert: 2026-10-06
