# Studie zeigt: Produktionsreifer SQL-Prüfer stimmt nur selten mit Menschen überein

> Forschende testeten einen KI-Prüfer in einer Text-to-SQL-Pipeline und stellten fest, dass er häufig anderer Meinung war als menschliche Prüfer. Ein selbst gehostetes Qwen-Modell schnitt deutlich besser ab – bei einem Bruchteil der Kosten pro Aufruf, berichtet die Studie.

Oossa · 2026-09-29 · https://oossa.com/de/study-finds-weak-agreement-from-a-production-sql-judge

Ein Team berichtet auf arXiv, dass sein eingesetzter GPT-4o-mini-Prüfer nur selten mit menschlichen Prüfern übereinstimmte, wenn es darum ging, zu beurteilen, ob von einer KI generiertes SQL zu einer Frage passte. Bei einer gezielt so zusammengestellten Stichprobe, die viele Fälle mit unterschiedlichen Bewertungen enthielt, lag die Übereinstimmung nahe null. Außerdem stufte der Prüfer fälschlicherweise 77,1 % der Fälle als nicht zutreffend ein, die Menschen für passend hielten.

Laut den Forschenden erreichte das selbst gehostete Modell Qwen3.6-27B eine ähnliche Übereinstimmung wie Claude Opus 4.7 – bei etwa einem Dreihundertstel der Kosten pro Aufruf. Sie weisen darauf hin, dass der direkte Vergleich nur 96 Beispiele umfasste.

## Die Fakten

- Cohen’s Kappa von GPT-4o mini lag bei 0,04 in einer Stichprobe mit gezielt vielen unterschiedlichen Bewertungen und bei 0,42 in einer stichprobenartigen Prüfung.
- Qwen3.6-27B erreichte ein Kappa von 0,72, Claude Opus 4.7 von 0,71.

## Warum es wichtig ist

Teams, die KI zur Bewertung generierter SQL-Abfragen einsetzen, sollten die Genauigkeit des Prüfers anhand menschlicher Bewertungen messen, bevor sie seinen Entscheidungen vertrauen.

## Quellen und Referenzen

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Zuletzt aktualisiert: 2026-09-29
