# Uno studio rileva scarso accordo con un giudice SQL in produzione

> I ricercatori hanno testato un giudice IA usato in una pipeline text-to-SQL e hanno scoperto che spesso non concordava con i revisori umani. Secondo lo studio, un modello Qwen ospitato autonomamente ha ottenuto risultati molto migliori a una frazione del costo per chiamata.

Oossa · 2026-09-29 · https://oossa.com/it/study-finds-weak-agreement-from-a-production-sql-judge

Un gruppo di ricercatori ha riferito su arXiv che il giudice GPT-4o mini impiegato in produzione concordava solo debolmente con i revisori umani nel valutare se l’SQL generato dall’IA corrispondesse a una domanda. In un insieme selezionato per includere numerosi casi di disaccordo, l’accordo era pressoché nullo; inoltre, il giudice ha segnalato erroneamente come non fedeli il 77,1% dei casi che gli esseri umani avevano giudicato fedeli.

Secondo i ricercatori, il modello Qwen3.6-27B, ospitato autonomamente, ha raggiunto un livello di accordo simile a quello di Claude Opus 4.7, con un costo per chiamata pari a circa un trecentesimo. Avvertono però che il confronto diretto ha riguardato soltanto 96 esempi.

## I fatti

- Il kappa di Cohen di GPT-4o mini era pari a 0,04 su un campione arricchito di casi di disaccordo e a 0,42 su un controllo a campione casuale.
- Qwen3.6-27B ha raggiunto un kappa di 0,72; Claude Opus 4.7 di 0,71.

## Perché conta

I team che usano l’IA per valutare SQL generato potrebbero dover misurare l’accuratezza del giudice confrontandola con le revisioni umane, prima di potersi fidare delle sue decisioni.

## Fonti e riferimenti

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Ultimo aggiornamento: 2026-09-29
