Oossa

APEX يسرّع توليد Qwen3-8B حتى 5.2×

يقلّص متحكّم APEX الجديد زمن الاستدلال لنموذج Qwen3-8B بمقدار يصل إلى 5.24 مرة، ويخفض الرموز التخمينية المهدرة بنسبة 41%.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

قدّم باحثون APEX، وهو متحكّم متعلّم يحدّد عدد الرموز التخمينية التي ينبغي توليدها وطريقة التخمين الواجب استخدامها. ويعمل المتحكّم مع محرّك الاستدلال vLLM، وقد اختُبر على نموذج اللغة Qwen3-8B. وفي ستة اختبارات معيارية، حقق APEX تسريعًا يصل إلى 5.24× مقارنةً بفك الترميز التوليدي الذاتي التقليدي. وحافظ إصدار APEX‑Depth على تسريع قدره 3.27×، مع خفض الرموز المهدرة بنسبة 41% مقارنةً بمسودة ثابتة من n‑gram بحجم 16.

لماذا يهم

يمكن للمطوّرين تشغيل نماذج اللغة الكبيرة بسرعة أكبر وبتكلفة أقل، ما يجعل ميزات الذكاء الاصطناعي الفورية في متناول الجميع بتكلفة معقولة أكثر.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.