Kort bericht · 1 min lezen
Onderzoek vindt weinig overeenstemming met een SQL-beoordelaar in productie
Onderzoekers testten een AI-beoordelaar in een text-to-SQL-pijplijn en ontdekten dat die het vaak oneens was met menselijke beoordelaars. Volgens het onderzoek presteerde een zelf gehost Qwen-model veel beter, tegen een fractie van de kosten per aanroep.
Oossa · Over Oossa
Een team meldt op arXiv dat de GPT-4o mini-beoordelaar die het in productie gebruikte, slechts weinig overeenstemming vertoonde met menselijke beoordelaars bij het controleren of door AI gegenereerde SQL overeenkwam met een vraag. In een dataset die was samengesteld om veel meningsverschillen te bevatten, was de overeenstemming vrijwel nul; bovendien bestempelde de beoordelaar 77,1% van de gevallen die mensen als correct beoordeelden ten onrechte als onjuist.
De onderzoekers zeggen dat een zelf gehost Qwen3.6-27B-model een vergelijkbare overeenstemming behaalde als Claude Opus 4.7, terwijl het per aanroep ongeveer driehonderd keer zo goedkoop was. Ze waarschuwen dat de directe vergelijking slechts 96 voorbeelden omvatte.
Waarom het ertoe doet
Teams die AI gebruiken om gegenereerde SQL te beoordelen, moeten mogelijk eerst de nauwkeurigheid van de beoordelaar meten aan de hand van menselijke beoordelingen voordat ze op diens beslissingen vertrouwen.
Bronnen en referenties
| # | Bron | Medium | Datum | Kernpunt |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28 sep 2026 | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 bronnen
Laatst bijgewerkt:
Oossa · Nieuwsbrief
De AI-week, uitgelegd
Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.