# Studie visar svag överensstämmelse hos en produktionssatt SQL-domare

> Forskare testade en AI-domare i en text-till-SQL-process och fann att den ofta gjorde andra bedömningar än mänskliga granskare. En Qwen-modell som kördes på egen infrastruktur presterade betydligt bättre till en bråkdel av kostnaden per anrop, enligt studien.

Oossa · 2026-09-29 · https://oossa.com/sv/study-finds-weak-agreement-from-a-production-sql-judge

Ett forskarlag rapporterar på arXiv att deras driftsatta GPT-4o mini-domare bara i liten utsträckning höll med mänskliga granskare när den bedömde om AI-genererad SQL stämde överens med en fråga. I ett urval som hade satts samman för att innehålla många meningsskiljaktigheter låg överensstämmelsen nära noll. Domaren felmarkerade dessutom 77.1% av de fall som människor bedömde som korrekta.

Forskarna uppger att en Qwen3.6-27B-modell som kördes på egen infrastruktur uppnådde en överensstämmelse i nivå med Claude Opus 4.7, samtidigt som den kostade ungefär en trehundradel per anrop. De betonar att den direkta jämförelsen bara omfattade 96 exempel.

## Fakta

- GPT-4o minis Cohens kappa var 0.04 i ett urval med många meningsskiljaktigheter och 0.42 i en slumpmässig stickprovskontroll.
- Qwen3.6-27B uppnådde en kappa på 0.72; Claude Opus 4.7 uppnådde 0.71.

## Varför det spelar roll

Team som använder AI för att bedöma genererad SQL kan behöva mäta domarens träffsäkerhet mot mänskliga granskningar innan de litar på dess beslut.

## Källor och referenser

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Senast uppdaterad: 2026-09-29
