پژوهشگران APEX را معرفی کردهاند؛ کنترلگری یادگرفتنی که تعیین میکند چند توکن پیشنویس تولید شود و از کدام روش حدسزنی استفاده شود. این ابزار به موتور استنتاج vLLM متصل میشود و روی مدل زبانی Qwen3-8B آزمایش شده است. APEX در شش بارکاری معیارسنجی، در مقایسه با رمزگشایی خودرگرسیو استاندارد، تا 5.24× افزایش سرعت داشت. گونه APEX‑Depth سرعت را 3.27× افزایش داد و در مقایسه با پیشنویس ثابت n‑gram با اندازه 16، توکنهای هدررفته را 41% کاهش داد.
چرا مهم است
توسعهدهندگان میتوانند مدلهای زبانی بزرگ را سریعتر و با هزینه کمتر اجرا کنند و قابلیتهای هوش مصنوعی بلادرنگ را مقرونبهصرفهتر در اختیار کاربران بگذارند.