संक्षिप्त · 1 मिनट पढ़ना
अध्ययन में प्रोडक्शन SQL जजों के बीच कमजोर सहमति मिली
शोधकर्ताओं ने टेक्स्ट-टू-SQL पाइपलाइन में इस्तेमाल होने वाले एक AI जज की जाँच की और पाया कि उसका फैसला अक्सर मानव समीक्षकों से मेल नहीं खाता। पेपर के मुताबिक, सेल्फ-होस्ट किए गए Qwen मॉडल ने प्रति कॉल लागत के एक छोटे अंश पर कहीं बेहतर प्रदर्शन किया।
Oossa · Oossa के बारे में
arXiv पर रिपोर्ट प्रकाशित करने वाली एक टीम ने पाया कि उसके तैनात GPT-4o mini जज का फैसला, AI से जनरेट किए गए SQL का किसी सवाल से मेल जाँचते समय, मानव समीक्षकों के फैसले से बहुत कम मेल खाता था। असहमतियों की संख्या ज़्यादा रखने के लिए चुने गए नमूने में सहमति लगभग शून्य थी; जज ने उन मामलों में से 77.1% को भी गलत तरीके से त्रुटिपूर्ण बताया जिन्हें मानव समीक्षकों ने सही माना था।
शोधकर्ताओं का कहना है कि सेल्फ-होस्ट किए गए Qwen3.6-27B मॉडल की सहमति Claude Opus 4.7 के समान रही, जबकि प्रति कॉल इसकी लागत लगभग तीन सौवें हिस्से के बराबर थी। उन्होंने आगाह किया कि सीधी तुलना में सिर्फ 96 उदाहरण शामिल थे।
यह क्यों मायने रखता है
AI से जनरेट किए गए SQL को परखने के लिए AI का इस्तेमाल करने वाली टीमों को उसके फैसलों पर भरोसा करने से पहले मानव समीक्षाओं के मुकाबले जज की सटीकता मापनी पड़ सकती है।
स्रोत और संदर्भ
| # | स्रोत | प्रकाशक | तारीख | मुख्य बात |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28 सित॰ 2026 | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 स्रोत
अंतिम अपडेट:
Oossa · न्यूज़लेटर
AI का हफ़्ता, आसान भाषा में
हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।