# APEX يسرّع توليد Qwen3-8B حتى 5.2×

> يقلّص متحكّم APEX الجديد زمن الاستدلال لنموذج Qwen3-8B بمقدار يصل إلى 5.24 مرة، ويخفض الرموز التخمينية المهدرة بنسبة 41%.

Oossa · 2026-10-07 · https://oossa.com/ar/apex-speeds-up-qwen3-8b-decoding-up-to-5-2

قدّم باحثون APEX، وهو متحكّم متعلّم يحدّد عدد الرموز التخمينية التي ينبغي توليدها وطريقة التخمين الواجب استخدامها. ويعمل المتحكّم مع محرّك الاستدلال vLLM، وقد اختُبر على نموذج اللغة Qwen3-8B. وفي ستة اختبارات معيارية، حقق APEX تسريعًا يصل إلى 5.24× مقارنةً بفك الترميز التوليدي الذاتي التقليدي. وحافظ إصدار APEX‑Depth على تسريع قدره 3.27×، مع خفض الرموز المهدرة بنسبة 41% مقارنةً بمسودة ثابتة من n‑gram بحجم 16.

## الحقائق

- تسريع يصل إلى 5.24× على Qwen3-8B (APEX-R)
- خفض الرموز المهدرة بنسبة 41.0% مقارنةً بـ n‑gram ثابت عند k=16 (APEX-B)

## لماذا يهم

يمكن للمطوّرين تشغيل نماذج اللغة الكبيرة بسرعة أكبر وبتكلفة أقل، ما يجعل ميزات الذكاء الاصطناعي الفورية في متناول الجميع بتكلفة معقولة أكثر.

## المصادر والمراجع

1. [APEX: Speculate smarter, not deeper](https://arxiv.org/abs/2610.07780) – arXiv, 2026-10-07

آخر تحديث: 2026-10-07
