Oossa

فرق وكلاء الذكاء الاصطناعي أغلى ونادراً ما تحسّن النتائج

تُظهر دراسة Vals AI أن الأنظمة متعددة الوكلاء قد تستهلك ما يصل إلى خمسة أضعاف الرموز مقارنة بنموذج واحد، مقابل تحسّن طفيف جداً في الجودة.

بقلم نشرته Oossa: 1 دقائق قراءة

تاريخ الحدث:

Marvin Meyer · Unsplash

قارنت دراسة تقييمية جديدة أجرتها Vals AI بين وكلاء ذكاء اصطناعي منفردين وفرق من الوكلاء على منصة Vibe Code Bench. واختبرت نموذجين رائدين — GPT‑6 Sol وClaude Opus 5.5 — في وضع الاستخدام المنفرد وضمن فرق تضم ما يصل إلى 100 وكيل. استهلكت الفرق من 1.8 × إلى 5.1 × من الرموز التي يستهلكها نموذج واحد، لكنها لم تحقق درجات أفضل إلا بفارق ضئيل للغاية.

ما الذي تُظهره الأرقام؟

من بين أربع مقارنات مباشرة، لم تكن النتيجة ذات دلالة إحصائية إلا في حالة واحدة: سجّل GPT‑6 Sol، عند مستوى استدلال متوسط، 7.3 نقاط إضافية عند تشغيله ضمن فريق. أما عند ضبط الاستدلال على الحد الأقصى، فلم يحقق أي من النموذجين تحسناً قابلاً للقياس. وتشير البيانات إلى أن كلفة الحوسبة الإضافية لأسراب الوكلاء نادراً ما تفضي إلى جودة أعلى، خصوصاً عندما تعمل النماذج بكامل طاقتها أصلاً.

لماذا لا تعني زيادة السرعة تحسّن المخرجات؟

ويتفق باحثون في OpenAI مع هذه النتيجة. ففي بودكاست، أشار Noam Brown إلى أن إضافة وكلاء تسرّع أساساً المهام التي يمكن تنفيذها بالتوازي، مثل البحث على الويب أو الرياضيات، لكنها لا تحسّن الإجابة نفسها. حلّ أربعة وكلاء مهمةً في نصف الوقت، لكن الكلفة تضاعفت أيضاً. وأظهر التوسع إلى عشرات الوكلاء عوائد متناقصة، فيما لا تضيف الأسراب الكبيرة قيمة في الأعمال الإبداعية مثل كتابة الروايات.

لماذا يهم

تحذّر الدراسة المطورين الذين يضعون ميزانيات للحوسبة السحابية من أن إضافة أعداد كبيرة من وكلاء الذكاء الاصطناعي سترفع النفقات على الأرجح من دون تحسين جودة المنتج. وعلى الشركات التي تخطط لتسريع المهام الروتينية أن توازن بين كلفة الرموز ومكاسب السرعة المحدودة، وقد يكون تحسين التعليمات الموجّهة إلى وكيل واحد خياراً أفضل.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.