Oossa

APEX让Qwen3-8B解码速度最高提升5.2倍

这款全新的APEX控制器可将Qwen3-8B模型的推理时间缩短至原来的1/5.24,同时减少41%的无效草稿词元。

简讯作者: Oossa 发布日期: 1 分钟阅读

研究人员推出了APEX,这是一种学习型控制器,可决定生成多少个草稿词元,以及采用哪种推测解码方法。它可接入vLLM推理引擎,并已在Qwen3-8B语言模型上进行测试。在六项基准测试任务中,与标准自回归解码相比,APEX的速度最高提升5.24倍。与草稿长度固定为16的n-gram方法相比,APEX‑Depth版本在将速度提升保持在3.27倍的同时,还减少了41%的无效词元。

为什么重要

开发者可以更快、更低成本地运行大型语言模型,让实时AI功能变得更实惠。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。