Oossa

Geometrisches Scoring verbessert die Antwortbewertung von Sprachmodellen

Eine neue Methode findet in den verborgenen Zuständen von Modellen eine Richtung, die Antworten bis zu 52 Punkte besser bewertet als die übliche Wahrscheinlichkeitsbewertung.

Von Von Oossa veröffentlicht: 1 Min. Lesezeit

Domenico Loia · Unsplash

Forschende haben herausgefunden, dass große Sprachmodelle ein geometrisches Signal dafür speichern, ob eine Antwort richtig ist. Indem sie die durchschnittliche Verschiebung der verborgenen Zustände von falschen zu richtigen Antworten betrachten, können sie einen Bewertungsvektor erstellen, der mögliche Antworten ohne Feinabstimmung einordnet. In Tests mit fünf Modellen mit 1 Milliarde bis 8 Milliarden Parametern übertraf das Verfahren den üblichen Zero-Shot-Ansatz mit Log-Wahrscheinlichkeiten um bis zu 32 Punkte bei ARC-Challenge und MMLU sowie um bis zu 52 Punkte bei TruthfulQA.

So funktioniert die Methode

Die Autorinnen und Autoren verwenden fünfzig gekennzeichnete Beispiele, lassen sie durch das Modell laufen, sammeln etwa auf halber Netzwerktiefe die verborgenen Repräsentationen und berechnen den mittleren Vektor, der von den Zuständen falscher zu denen richtiger Antworten weist. Bei der Inferenz benötigt jede mögliche Antwort nur einen Durchlauf durchs Modell und ein einziges Skalarprodukt mit diesem Vektor. Es wird kein Antworttext erzeugt und keine Modellparameter werden verändert.

Was das für die Zuverlässigkeit von Modellen bedeutet

Als Halluzinationsdetektor erreicht die geometrische Richtung einen AUROC-Wert von 0.693, verglichen mit 0.578 bei der üblichen Wahrscheinlichkeitsbewertung. Die Studie zeigt außerdem, dass Signale für die Richtigkeit bei faktischem Schlussfolgern, Domänenwissen und Wahrheitsgehalt nahezu orthogonale Unterräume belegen. Das bedeutet, dass Modelle für unterschiedliche Arten von Richtigkeit getrennte Signale speichern. Dies könnte erklären, warum Modelle die richtige Antwort intern oft kennen, sie aber trotzdem nicht ausgeben.

Warum es wichtig ist

Für Nutzerinnen und Nutzer könnte das Verfahren zu verlässlicheren Antworten von Chatbots führen, insbesondere bei Faktenfragen. Außerdem deutet es auf eine Möglichkeit hin, wahrscheinliche Halluzinationen ohne hohen Rechenaufwand zu erkennen. Allerdings setzt das Verfahren weiterhin Zugriff auf verborgene Modellzustände voraus, die von den meisten öffentlichen APIs nicht offengelegt werden.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.