خبر کوتاه · 1 دقیقه مطالعه
مطالعهای از توافق ضعیف داور SQL در محیط تولید خبر میدهد
پژوهشگران یک داور هوش مصنوعی را که در فرایند تبدیل متن به SQL به کار میرود آزمایش کردند و دریافتند که این سامانه اغلب با ارزیابان انسانی اختلاف نظر دارد. بنا بر گزارش مقاله، یک مدل Qwen که روی سرور خودشان اجرا میشد، با کسری از هزینه هر بار فراخوانی عملکرد بسیار بهتری داشت.
Oossa · درباره Oossa
گروهی از پژوهشگران در مقالهای که در arXiv منتشر شده، گزارش دادند داور GPT-4o mini که در محیط عملیاتی به کار گرفته بودند، هنگام بررسی انطباق SQL تولیدشده با هوش مصنوعی با پرسش کاربر، فقط توافق اندکی با ارزیابان انسانی داشت. در مجموعهای که عمداً موارد اختلافنظر زیادی در آن گنجانده شده بود، میزان توافق نزدیک به صفر بود؛ این داور همچنین ۷۷.۱ درصد از مواردی را که انسانها منطبق تشخیص داده بودند، بهاشتباه رد کرد.
پژوهشگران میگویند مدل Qwen3.6-27B که روی سرور خودشان اجرا میشد، به توافقی مشابه Claude Opus 4.7 رسید و هزینه هر بار فراخوانی آن حدود یکسیصدم بود. آنها هشدار میدهند که مقایسه مستقیم فقط ۹۶ نمونه را در بر میگرفت.
چرا مهم است
تیمهایی که از هوش مصنوعی برای ارزیابی SQL تولیدشده استفاده میکنند، پیش از اعتماد به تصمیمهای آن باید دقت داور را در مقایسه با ارزیابیهای انسانی بسنجند.
منابع و ارجاعها
| # | منبع | رسانه | تاریخ | نکته اصلی |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | ۶ مهر ۱۴۰۵ | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 منبع
آخرین بهروزرسانی:
Oossa · خبرنامه
هفتهٔ هوش مصنوعی، به زبان ساده
هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.