Kurzmeldung · 1 Min. Lesezeit
Studie zeigt: Produktionsreifer SQL-Prüfer stimmt nur selten mit Menschen überein
Forschende testeten einen KI-Prüfer in einer Text-to-SQL-Pipeline und stellten fest, dass er häufig anderer Meinung war als menschliche Prüfer. Ein selbst gehostetes Qwen-Modell schnitt deutlich besser ab – bei einem Bruchteil der Kosten pro Aufruf, berichtet die Studie.
Oossa · Über Oossa
Ein Team berichtet auf arXiv, dass sein eingesetzter GPT-4o-mini-Prüfer nur selten mit menschlichen Prüfern übereinstimmte, wenn es darum ging, zu beurteilen, ob von einer KI generiertes SQL zu einer Frage passte. Bei einer gezielt so zusammengestellten Stichprobe, die viele Fälle mit unterschiedlichen Bewertungen enthielt, lag die Übereinstimmung nahe null. Außerdem stufte der Prüfer fälschlicherweise 77,1 % der Fälle als nicht zutreffend ein, die Menschen für passend hielten.
Laut den Forschenden erreichte das selbst gehostete Modell Qwen3.6-27B eine ähnliche Übereinstimmung wie Claude Opus 4.7 – bei etwa einem Dreihundertstel der Kosten pro Aufruf. Sie weisen darauf hin, dass der direkte Vergleich nur 96 Beispiele umfasste.
Warum es wichtig ist
Teams, die KI zur Bewertung generierter SQL-Abfragen einsetzen, sollten die Genauigkeit des Prüfers anhand menschlicher Bewertungen messen, bevor sie seinen Entscheidungen vertrauen.
Quellen und Referenzen
| # | Quelle | Medium | Datum | Kernaussage |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28.09.2026 | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 Quellen
Zuletzt aktualisiert:
Oossa · Newsletter
Die KI-Woche, erklärt
Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.