# مطالعه‌ای از توافق ضعیف داور SQL در محیط تولید خبر می‌دهد

> پژوهشگران یک داور هوش مصنوعی را که در فرایند تبدیل متن به SQL به کار می‌رود آزمایش کردند و دریافتند که این سامانه اغلب با ارزیابان انسانی اختلاف نظر دارد. بنا بر گزارش مقاله، یک مدل Qwen که روی سرور خودشان اجرا می‌شد، با کسری از هزینه هر بار فراخوانی عملکرد بسیار بهتری داشت.

Oossa · 2026-09-29 · https://oossa.com/fa/study-finds-weak-agreement-from-a-production-sql-judge

گروهی از پژوهشگران در مقاله‌ای که در arXiv منتشر شده، گزارش دادند داور GPT-4o mini که در محیط عملیاتی به کار گرفته بودند، هنگام بررسی انطباق SQL تولیدشده با هوش مصنوعی با پرسش کاربر، فقط توافق اندکی با ارزیابان انسانی داشت. در مجموعه‌ای که عمداً موارد اختلاف‌نظر زیادی در آن گنجانده شده بود، میزان توافق نزدیک به صفر بود؛ این داور همچنین ۷۷.۱ درصد از مواردی را که انسان‌ها منطبق تشخیص داده بودند، به‌اشتباه رد کرد.

پژوهشگران می‌گویند مدل Qwen3.6-27B که روی سرور خودشان اجرا می‌شد، به توافقی مشابه Claude Opus 4.7 رسید و هزینه هر بار فراخوانی آن حدود یک‌سیصدم بود. آن‌ها هشدار می‌دهند که مقایسه مستقیم فقط ۹۶ نمونه را در بر می‌گرفت.

## حقایق

- ضریب کاپای کوهن برای GPT-4o mini در نمونه‌ای که موارد اختلاف‌نظر در آن بیشتر بود، ۰.۰۴ و در بررسی تصادفی ۰.۴۲ بود.
- ضریب کاپا برای Qwen3.6-27B به ۰.۷۲ و برای Claude Opus 4.7 به ۰.۷۱ رسید.

## چرا مهم است

تیم‌هایی که از هوش مصنوعی برای ارزیابی SQL تولیدشده استفاده می‌کنند، پیش از اعتماد به تصمیم‌های آن باید دقت داور را در مقایسه با ارزیابی‌های انسانی بسنجند.

## منابع و ارجاع‌ها

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

آخرین به‌روزرسانی: 2026-09-29
