# Un estudio detecta poco acuerdo con un evaluador SQL usado en producción

> Investigadores pusieron a prueba un evaluador de IA integrado en un flujo de trabajo de texto a SQL y descubrieron que a menudo discrepaba de los revisores humanos. Según el estudio, un modelo Qwen autoalojado rindió mucho mejor y costó una fracción por consulta.

Oossa · 2026-09-29 · https://oossa.com/es/study-finds-weak-agreement-from-a-production-sql-judge

Un equipo que publicó sus resultados en arXiv descubrió que el evaluador GPT-4o mini que tenían en producción apenas coincidía con los revisores humanos al comprobar si el SQL generado por IA se ajustaba a una pregunta. En un conjunto seleccionado para incluir muchos desacuerdos, la concordancia fue casi nula; además, el evaluador señaló incorrectamente el 77,1 % de los casos que los humanos consideraron fieles.

Los investigadores afirman que un modelo Qwen3.6-27B autoalojado logró una concordancia similar a la de Claude Opus 4.7, con un costo por consulta de aproximadamente una trescentésima parte. Advierten que la comparación directa incluyó solo 96 ejemplos.

## Los hechos

- El kappa de Cohen de GPT-4o mini fue de 0,04 en una muestra enriquecida con casos de desacuerdo y de 0,42 en una revisión aleatoria.
- Qwen3.6-27B obtuvo un kappa de 0,72; Claude Opus 4.7, de 0,71.

## Por qué importa

Los equipos que usan IA para evaluar SQL generado quizá deban medir la precisión del evaluador comparándola con revisiones humanas antes de confiar en sus decisiones.

## Fuentes y referencias

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Última actualización: 2026-09-29
