llama.cpp项目于2026‑10‑07发布b11474版。该版本为模型运行器加入了名为NextN的GLM5‑Next多令牌预测(MTP)计算图。通过在无需输出行时跳过不必要的计算,这项改动将4令牌追赶延迟从6.9 ms降至0.33 ms。此次更新还修复了提取契约,并改进了对部分循环回滚的处理。
为什么重要
开发者现在可以更快地运行llama.cpp模型,尤其是在使用依赖多令牌预测的草稿式生成时。
这款开源大语言模型运行器现已支持新的GLM5‑Next MTP头,4令牌追赶延迟降至0.33 ms。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
llama.cpp项目于2026‑10‑07发布b11474版。该版本为模型运行器加入了名为NextN的GLM5‑Next多令牌预测(MTP)计算图。通过在无需输出行时跳过不必要的计算,这项改动将4令牌追赶延迟从6.9 ms降至0.33 ms。此次更新还修复了提取契约,并改进了对部分循环回滚的处理。
开发者现在可以更快地运行llama.cpp模型,尤其是在使用依赖多令牌预测的草稿式生成时。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。