# APEX让Qwen3-8B解码速度最高提升5.2倍

> 这款全新的APEX控制器可将Qwen3-8B模型的推理时间缩短至原来的1/5.24，同时减少41%的无效草稿词元。

Oossa · 2026-10-07 · https://oossa.com/zh/apex-speeds-up-qwen3-8b-decoding-up-to-5-2

研究人员推出了APEX，这是一种学习型控制器，可决定生成多少个草稿词元，以及采用哪种推测解码方法。它可接入vLLM推理引擎，并已在Qwen3-8B语言模型上进行测试。在六项基准测试任务中，与标准自回归解码相比，APEX的速度最高提升5.24倍。与草稿长度固定为16的n-gram方法相比，APEX‑Depth版本在将速度提升保持在3.27倍的同时，还减少了41%的无效词元。

## 事实

- APEX-R在Qwen3-8B上的速度最高提升5.24倍
- 与固定n‑gram k=16相比，APEX-B的无效词元减少41.0%

## 为什么重要

开发者可以更快、更低成本地运行大型语言模型，让实时AI功能变得更实惠。

## 来源与参考

1. [APEX: Speculate smarter, not deeper](https://arxiv.org/abs/2610.07780) – arXiv, 2026-10-07

最后更新: 2026-10-07
