# 연구 결과, 실제 운영 중인 SQL 판정기의 인간 평가자와의 일치도 낮아

> 연구진은 텍스트를 SQL로 변환하는 파이프라인에 쓰이는 AI 판정기를 시험한 결과, 인간 검토자와 의견이 자주 엇갈렸다고 밝혔다. 논문에 따르면 자체 호스팅한 Qwen 모델은 호출당 비용이 훨씬 적은데도 성능이 훨씬 뛰어났다.

Oossa · 2026-09-29 · https://oossa.com/ko/study-finds-weak-agreement-from-a-production-sql-judge

arXiv에 연구 결과를 공개한 연구팀은 운영 환경에 배포한 GPT-4o mini 판정기가 AI 생성 SQL이 질문에 부합하는지 확인할 때 인간 검토자와의 일치도가 낮았다고 밝혔다. 의견 불일치 사례가 많이 포함되도록 선정한 데이터셋에서는 일치도가 거의 0에 가까웠고, 인간이 질문에 부합한다고 판단한 사례 중 77.1%를 잘못 부적합하다고 판정했다.

연구진에 따르면 자체 호스팅한 Qwen3.6-27B 모델은 Claude Opus 4.7과 비슷한 수준의 일치도를 보였으며, 호출당 비용은 약 300분의 1에 그쳤다. 다만 두 모델의 직접 비교에는 96개 사례만 사용됐다고 연구진은 주의를 당부했다.

## 팩트

- GPT-4o mini의 Cohen’s kappa는 의견 불일치 사례를 많이 포함한 표본에서 0.04, 무작위 점검 표본에서 0.42였다.
- Qwen3.6-27B의 kappa는 0.72, Claude Opus 4.7의 kappa는 0.71이었다.

## 왜 중요한가

AI로 생성한 SQL을 평가하는 팀은 판정 결과를 신뢰하기 전에 인간 검토 결과와 비교해 판정기의 정확도를 측정할 필요가 있다.

## 출처 및 참고 자료

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

최종 업데이트: 2026-09-29
