# 本番環境のSQL判定モデル、人間との一致度は低いとの調査

> テキストからSQLを生成するパイプラインで使われているAI判定モデルを研究者らが検証したところ、人間のレビュアーと意見が食い違うことが多かった。論文によると、自前でホストしたQwenモデルは、1回あたりのコストが大幅に低い一方で、性能ははるかに優れていた。

Oossa · 2026-09-29 · https://oossa.com/ja/study-finds-weak-agreement-from-a-production-sql-judge

arXivで報告した研究チームによると、導入済みのGPT-4o mini判定モデルは、AIが生成したSQLが質問に合致しているかを確認する際、人間のレビュアーとの一致度が低かった。意見の食い違いが多くなるよう選んだデータセットでは、一致度はほぼゼロだった。また、人間が質問に忠実だと判断したケースの77.1%を、誤って不適切と判定した。

研究者らによると、自前でホストしたQwen3.6-27BモデルはClaude Opus 4.7と同程度の一致度を達成し、1回あたりの費用は約300分の1だった。ただし、直接比較に使った例は96件のみだとしている。

## 事実

- 意見の食い違いが多くなるよう選んだサンプルでのGPT-4o miniのCohenのκ係数は0.04、無作為抽出によるスポットチェックでは0.42だった。
- Qwen3.6-27Bのκ係数は0.72、Claude Opus 4.7は0.71だった。

## なぜ重要か

生成SQLをAIで採点するチームは、その判定を信頼する前に、人間によるレビューと照らし合わせて判定モデルの精度を測る必要があるかもしれない。

## 出典と参考資料

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

最終更新: 2026-09-29
