# دراسة تكشف ضعف التوافق مع مُحكِّم SQL مستخدم في الإنتاج

> اختبر باحثون مُحكِّمًا يعمل بالذكاء الاصطناعي ضمن مسار عمل لتحويل النص إلى SQL، ووجدوا أنه كثيرًا ما خالف المراجعين البشر. وذكر البحث أن نموذج Qwen المستضاف ذاتيًا قدّم أداءً أفضل بكثير، بتكلفة لا تتجاوز جزءًا بسيطًا من تكلفة كل استدعاء.

Oossa · 2026-09-29 · https://oossa.com/ar/study-finds-weak-agreement-from-a-production-sql-judge

وجد فريق نشر نتائج بحثه على arXiv أن مُحكِّم GPT-4o mini الذي يستخدمه في الإنتاج لم يتوافق إلا بدرجة محدودة مع المراجعين البشر عند التحقق مما إذا كانت استعلامات SQL التي يولدها الذكاء الاصطناعي تطابق السؤال. وفي مجموعة اختيرت لتضم عددًا كبيرًا من حالات الاختلاف، اقترب التوافق من الصفر؛ كما صنّف المُحكِّم خطأً 77.1% من الحالات التي رأى البشر أنها مطابقة.

ويقول الباحثون إن نموذج Qwen3.6-27B المستضاف ذاتيًا حقق مستوى توافق مماثلًا لـ Claude Opus 4.7، فيما بلغت تكلفة الاستدعاء الواحد نحو واحد على ثلاثمئة من تكلفته. لكنهم يشيرون إلى أن المقارنة المباشرة شملت 96 مثالًا فقط.

## الحقائق

- بلغ معامل كابا لكوهين في GPT-4o mini مقدار 0.04 في عينة زيدت فيها حالات الاختلاف، و0.42 في فحص عشوائي.
- حقق Qwen3.6-27B معامل كابا بلغ 0.72، مقابل 0.71 لـ Claude Opus 4.7.

## لماذا يهم

قد تحتاج الفرق التي تستخدم الذكاء الاصطناعي لتقييم استعلامات SQL المُولّدة إلى قياس دقة المُحكِّم بمقارنتها بمراجعات البشر قبل الوثوق بقراراته.

## المصادر والمراجع

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

آخر تحديث: 2026-09-29
