# 研究发现，生产环境中的 SQL 评判模型与人工意见一致性较低

> 研究人员测试了文本转 SQL 流程中使用的一款 AI 评判模型，发现它的判断常与人工审核人员不一致。论文称，一款自托管的 Qwen 模型表现好得多，而且单次调用成本仅为前者的一小部分。

Oossa · 2026-09-29 · https://oossa.com/zh/study-finds-weak-agreement-from-a-production-sql-judge

一支在 arXiv 发布研究报告的团队发现，在检查 AI 生成的 SQL 是否符合问题要求时，其已部署的 GPT-4o mini 评判模型与人工审核人员的意见一致性较低。在一个特意选入大量意见分歧案例的样本中，双方几乎没有一致；此外，对于人工认定符合要求的案例，该模型有 77.1% 错误地标记为不符合。

研究人员表示，自托管的 Qwen3.6-27B 模型与 Claude Opus 4.7 的一致性相近，而单次调用成本约为其三百分之一。他们提醒说，直接比较仅涉及 96 个样本。

## 事实

- 在包含较多意见分歧的样本中，GPT-4o mini 的 Cohen’s kappa 为 0.04；在随机抽查中为 0.42。
- Qwen3.6-27B 的 kappa 达到 0.72；Claude Opus 4.7 为 0.71。

## 为什么重要

使用 AI 评判生成 SQL 的团队，在信任其判断之前，可能需要先对照人工审核结果，衡量评判模型的准确性。

## 来源与参考

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

最后更新: 2026-09-29
