# APEX رمزگشایی Qwen3-8B را تا ۵٫۲ برابر سریع‌تر می‌کند

> کنترل‌گر جدید APEX زمان استنتاج مدل Qwen3-8B را تا 5.24 برابر کاهش می‌دهد و هم‌زمان توکن‌های پیش‌نویس هدررفته را 41% کمتر می‌کند.

Oossa · 2026-10-07 · https://oossa.com/fa/apex-speeds-up-qwen3-8b-decoding-up-to-5-2

پژوهشگران APEX را معرفی کرده‌اند؛ کنترل‌گری یادگرفتنی که تعیین می‌کند چند توکن پیش‌نویس تولید شود و از کدام روش حدس‌زنی استفاده شود. این ابزار به موتور استنتاج vLLM متصل می‌شود و روی مدل زبانی Qwen3-8B آزمایش شده است. APEX در شش بارکاری معیارسنجی، در مقایسه با رمزگشایی خودرگرسیو استاندارد، تا 5.24× افزایش سرعت داشت. گونه APEX‑Depth سرعت را 3.27× افزایش داد و در مقایسه با پیش‌نویس ثابت n‑gram با اندازه 16، توکن‌های هدررفته را 41% کاهش داد.

## حقایق

- افزایش سرعت تا 5.24× در Qwen3-8B (APEX-R)
- کاهش 41.0% توکن‌های هدررفته در مقایسه با n‑gram ثابت با k=16 (APEX-B)

## چرا مهم است

توسعه‌دهندگان می‌توانند مدل‌های زبانی بزرگ را سریع‌تر و با هزینه کمتر اجرا کنند و قابلیت‌های هوش مصنوعی بلادرنگ را مقرون‌به‌صرفه‌تر در اختیار کاربران بگذارند.

## منابع و ارجاع‌ها

1. [APEX: Speculate smarter, not deeper](https://arxiv.org/abs/2610.07780) – arXiv, 2026-10-07

آخرین به‌روزرسانی: 2026-10-07
