# Estudo aponta baixa concordância de um avaliador de SQL em produção

> Pesquisadores testaram um avaliador de IA usado em um pipeline de conversão de texto em SQL e descobriram que ele discordava com frequência dos revisores humanos. Segundo o artigo, um modelo Qwen auto-hospedado teve desempenho bem melhor por uma fração do custo por chamada.

Oossa · 2026-09-29 · https://oossa.com/pt/study-finds-weak-agreement-from-a-production-sql-judge

Uma equipe que publicou os resultados no arXiv constatou que o avaliador GPT-4o mini em produção concordava pouco com os revisores humanos ao verificar se o SQL gerado por IA correspondia à pergunta. Em um conjunto selecionado para incluir muitas divergências, a concordância ficou próxima de zero; o avaliador também classificou incorretamente como fiéis 77.1% dos casos que os humanos consideraram corretos.

Os pesquisadores afirmam que um modelo Qwen3.6-27B auto-hospedado alcançou concordância semelhante à do Claude Opus 4.7, com custo por chamada cerca de trezentas vezes menor. Eles ressalvam que a comparação direta envolveu apenas 96 exemplos.

## Os fatos

- O kappa de Cohen do GPT-4o mini foi de 0.04 em uma amostra selecionada para conter muitas divergências e de 0.42 em uma verificação aleatória.
- O Qwen3.6-27B alcançou kappa de 0.72; o Claude Opus 4.7, de 0.71.

## Por que importa

Equipes que usam IA para avaliar SQL gerado talvez precisem medir a precisão do avaliador em comparação com revisões humanas antes de confiar em suas decisões.

## Fontes e referências

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Última atualização: 2026-09-29
