Nota · 1 min de leitura
Estudo aponta baixa concordância de um avaliador de SQL em produção
Pesquisadores testaram um avaliador de IA usado em um pipeline de conversão de texto em SQL e descobriram que ele discordava com frequência dos revisores humanos. Segundo o artigo, um modelo Qwen auto-hospedado teve desempenho bem melhor por uma fração do custo por chamada.
Oossa · Sobre a Oossa
Uma equipe que publicou os resultados no arXiv constatou que o avaliador GPT-4o mini em produção concordava pouco com os revisores humanos ao verificar se o SQL gerado por IA correspondia à pergunta. Em um conjunto selecionado para incluir muitas divergências, a concordância ficou próxima de zero; o avaliador também classificou incorretamente como fiéis 77.1% dos casos que os humanos consideraram corretos.
Os pesquisadores afirmam que um modelo Qwen3.6-27B auto-hospedado alcançou concordância semelhante à do Claude Opus 4.7, com custo por chamada cerca de trezentas vezes menor. Eles ressalvam que a comparação direta envolveu apenas 96 exemplos.
Por que importa
Equipes que usam IA para avaliar SQL gerado talvez precisem medir a precisão do avaliador em comparação com revisões humanas antes de confiar em suas decisões.
Fontes e referências
| # | Fonte | Veículo | Data | Ponto principal |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28 de set. de 2026 | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 fontes
Última atualização:
Oossa · Newsletter
A semana em IA, explicada
Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.