Oossaهوش مصنوعی به‌سرعت پیشرفت می‌کند. ما آن را ساده توضیح می‌دهیم.
خبرنامه

خبر کوتاه · 1 دقیقه مطالعه

مطالعه‌ای از توافق ضعیف داور SQL در محیط تولید خبر می‌دهد

پژوهشگران یک داور هوش مصنوعی را که در فرایند تبدیل متن به SQL به کار می‌رود آزمایش کردند و دریافتند که این سامانه اغلب با ارزیابان انسانی اختلاف نظر دارد. بنا بر گزارش مقاله، یک مدل Qwen که روی سرور خودشان اجرا می‌شد، با کسری از هزینه هر بار فراخوانی عملکرد بسیار بهتری داشت.

Oossa · درباره Oossa

گروهی از پژوهشگران در مقاله‌ای که در arXiv منتشر شده، گزارش دادند داور GPT-4o mini که در محیط عملیاتی به کار گرفته بودند، هنگام بررسی انطباق SQL تولیدشده با هوش مصنوعی با پرسش کاربر، فقط توافق اندکی با ارزیابان انسانی داشت. در مجموعه‌ای که عمداً موارد اختلاف‌نظر زیادی در آن گنجانده شده بود، میزان توافق نزدیک به صفر بود؛ این داور همچنین ۷۷.۱ درصد از مواردی را که انسان‌ها منطبق تشخیص داده بودند، به‌اشتباه رد کرد.

پژوهشگران می‌گویند مدل Qwen3.6-27B که روی سرور خودشان اجرا می‌شد، به توافقی مشابه Claude Opus 4.7 رسید و هزینه هر بار فراخوانی آن حدود یک‌سیصدم بود. آن‌ها هشدار می‌دهند که مقایسه مستقیم فقط ۹۶ نمونه را در بر می‌گرفت.

چرا مهم است

تیم‌هایی که از هوش مصنوعی برای ارزیابی SQL تولیدشده استفاده می‌کنند، پیش از اعتماد به تصمیم‌های آن باید دقت داور را در مقایسه با ارزیابی‌های انسانی بسنجند.

آیا این مقاله مفید بود؟

منابع و ارجاع‌ها

#منبعرسانهتاریخنکته اصلی
1Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗arXiv۶ مهر ۱۴۰۵arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a

1 منبع

آخرین به‌روزرسانی:

Oossallms.txt.md

اشتراک‌گذاری

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.

مطالعه‌ای از توافق ضعیف داور SQL در محیط تولید خبر می‌دهد – Oossa