OossaA IA evolui rápido. Nós explicamos de forma simples.
Newsletter

Nota · 1 min de leitura

Estudo aponta baixa concordância de um avaliador de SQL em produção

Pesquisadores testaram um avaliador de IA usado em um pipeline de conversão de texto em SQL e descobriram que ele discordava com frequência dos revisores humanos. Segundo o artigo, um modelo Qwen auto-hospedado teve desempenho bem melhor por uma fração do custo por chamada.

Oossa · Sobre a Oossa

Uma equipe que publicou os resultados no arXiv constatou que o avaliador GPT-4o mini em produção concordava pouco com os revisores humanos ao verificar se o SQL gerado por IA correspondia à pergunta. Em um conjunto selecionado para incluir muitas divergências, a concordância ficou próxima de zero; o avaliador também classificou incorretamente como fiéis 77.1% dos casos que os humanos consideraram corretos.

Os pesquisadores afirmam que um modelo Qwen3.6-27B auto-hospedado alcançou concordância semelhante à do Claude Opus 4.7, com custo por chamada cerca de trezentas vezes menor. Eles ressalvam que a comparação direta envolveu apenas 96 exemplos.

Por que importa

Equipes que usam IA para avaliar SQL gerado talvez precisem medir a precisão do avaliador em comparação com revisões humanas antes de confiar em suas decisões.

Este artigo foi útil?

Fontes e referências

#FonteVeículoDataPonto principal
1Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗arXiv28 de set. de 2026arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a

1 fontes

Última atualização:

Oossallms.txt.md

Compartilhar

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.

Estudo aponta baixa concordância de um avaliador de SQL em produção – Oossa