# अध्ययन में प्रोडक्शन SQL जजों के बीच कमजोर सहमति मिली

> शोधकर्ताओं ने टेक्स्ट-टू-SQL पाइपलाइन में इस्तेमाल होने वाले एक AI जज की जाँच की और पाया कि उसका फैसला अक्सर मानव समीक्षकों से मेल नहीं खाता। पेपर के मुताबिक, सेल्फ-होस्ट किए गए Qwen मॉडल ने प्रति कॉल लागत के एक छोटे अंश पर कहीं बेहतर प्रदर्शन किया।

Oossa · 2026-09-29 · https://oossa.com/hi/study-finds-weak-agreement-from-a-production-sql-judge

arXiv पर रिपोर्ट प्रकाशित करने वाली एक टीम ने पाया कि उसके तैनात GPT-4o mini जज का फैसला, AI से जनरेट किए गए SQL का किसी सवाल से मेल जाँचते समय, मानव समीक्षकों के फैसले से बहुत कम मेल खाता था। असहमतियों की संख्या ज़्यादा रखने के लिए चुने गए नमूने में सहमति लगभग शून्य थी; जज ने उन मामलों में से 77.1% को भी गलत तरीके से त्रुटिपूर्ण बताया जिन्हें मानव समीक्षकों ने सही माना था।

शोधकर्ताओं का कहना है कि सेल्फ-होस्ट किए गए Qwen3.6-27B मॉडल की सहमति Claude Opus 4.7 के समान रही, जबकि प्रति कॉल इसकी लागत लगभग तीन सौवें हिस्से के बराबर थी। उन्होंने आगाह किया कि सीधी तुलना में सिर्फ 96 उदाहरण शामिल थे।

## तथ्य

- असहमति वाले मामलों से समृद्ध नमूने में GPT-4o mini का Cohen’s kappa 0.04 था, जबकि यादृच्छिक स्पॉट-चेक में यह 0.42 था।
- Qwen3.6-27B का kappa 0.72 रहा; Claude Opus 4.7 का 0.71।

## यह क्यों मायने रखता है

AI से जनरेट किए गए SQL को परखने के लिए AI का इस्तेमाल करने वाली टीमों को उसके फैसलों पर भरोसा करने से पहले मानव समीक्षाओं के मुकाबले जज की सटीकता मापनी पड़ सकती है।

## स्रोत और संदर्भ

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

अंतिम अपडेट: 2026-09-29
