خبر موجز · 1 دقائق قراءة
دراسة تكشف ضعف التوافق مع مُحكِّم SQL مستخدم في الإنتاج
اختبر باحثون مُحكِّمًا يعمل بالذكاء الاصطناعي ضمن مسار عمل لتحويل النص إلى SQL، ووجدوا أنه كثيرًا ما خالف المراجعين البشر. وذكر البحث أن نموذج Qwen المستضاف ذاتيًا قدّم أداءً أفضل بكثير، بتكلفة لا تتجاوز جزءًا بسيطًا من تكلفة كل استدعاء.
Oossa · عن Oossa
وجد فريق نشر نتائج بحثه على arXiv أن مُحكِّم GPT-4o mini الذي يستخدمه في الإنتاج لم يتوافق إلا بدرجة محدودة مع المراجعين البشر عند التحقق مما إذا كانت استعلامات SQL التي يولدها الذكاء الاصطناعي تطابق السؤال. وفي مجموعة اختيرت لتضم عددًا كبيرًا من حالات الاختلاف، اقترب التوافق من الصفر؛ كما صنّف المُحكِّم خطأً 77.1% من الحالات التي رأى البشر أنها مطابقة.
ويقول الباحثون إن نموذج Qwen3.6-27B المستضاف ذاتيًا حقق مستوى توافق مماثلًا لـ Claude Opus 4.7، فيما بلغت تكلفة الاستدعاء الواحد نحو واحد على ثلاثمئة من تكلفته. لكنهم يشيرون إلى أن المقارنة المباشرة شملت 96 مثالًا فقط.
لماذا يهم
قد تحتاج الفرق التي تستخدم الذكاء الاصطناعي لتقييم استعلامات SQL المُولّدة إلى قياس دقة المُحكِّم بمقارنتها بمراجعات البشر قبل الوثوق بقراراته.
المصادر والمراجع
| # | المصدر | الجهة الناشرة | التاريخ | الخلاصة |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28/09/2026 | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 مصادر
آخر تحديث:
Oossa · النشرة البريدية
أسبوع الذكاء الاصطناعي، مشروحًا
كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.