# Onderzoek vindt weinig overeenstemming met een SQL-beoordelaar in productie

> Onderzoekers testten een AI-beoordelaar in een text-to-SQL-pijplijn en ontdekten dat die het vaak oneens was met menselijke beoordelaars. Volgens het onderzoek presteerde een zelf gehost Qwen-model veel beter, tegen een fractie van de kosten per aanroep.

Oossa · 2026-09-29 · https://oossa.com/nl/study-finds-weak-agreement-from-a-production-sql-judge

Een team meldt op arXiv dat de GPT-4o mini-beoordelaar die het in productie gebruikte, slechts weinig overeenstemming vertoonde met menselijke beoordelaars bij het controleren of door AI gegenereerde SQL overeenkwam met een vraag. In een dataset die was samengesteld om veel meningsverschillen te bevatten, was de overeenstemming vrijwel nul; bovendien bestempelde de beoordelaar 77,1% van de gevallen die mensen als correct beoordeelden ten onrechte als onjuist.

De onderzoekers zeggen dat een zelf gehost Qwen3.6-27B-model een vergelijkbare overeenstemming behaalde als Claude Opus 4.7, terwijl het per aanroep ongeveer driehonderd keer zo goedkoop was. Ze waarschuwen dat de directe vergelijking slechts 96 voorbeelden omvatte.

## De feiten

- Cohen’s kappa voor GPT-4o mini was 0,04 op een steekproef die extra veel meningsverschillen bevatte, en 0,42 bij een willekeurige steekproefcontrole.
- Qwen3.6-27B behaalde een kappa van 0,72; Claude Opus 4.7 kwam uit op 0,71.

## Waarom het ertoe doet

Teams die AI gebruiken om gegenereerde SQL te beoordelen, moeten mogelijk eerst de nauwkeurigheid van de beoordelaar meten aan de hand van menselijke beoordelingen voordat ze op diens beslissingen vertrouwen.

## Bronnen en referenties

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Laatst bijgewerkt: 2026-09-29
