Oossa

llama.cpp新增GLM5‑Next多令牌预测并提升速度

这款开源大语言模型运行器现已支持新的GLM5‑Next MTP头,4令牌追赶延迟降至0.33 ms。

简讯作者: Oossa 发布日期: 1 分钟阅读

llama.cpp项目于2026‑10‑07发布b11474版。该版本为模型运行器加入了名为NextN的GLM5‑Next多令牌预测(MTP)计算图。通过在无需输出行时跳过不必要的计算,这项改动将4令牌追赶延迟从6.9 ms降至0.33 ms。此次更新还修复了提取契约,并改进了对部分循环回滚的处理。

为什么重要

开发者现在可以更快地运行llama.cpp模型,尤其是在使用依赖多令牌预测的草稿式生成时。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。