# llama.cpp新增GLM5‑Next多令牌预测并提升速度

> 这款开源大语言模型运行器现已支持新的GLM5‑Next MTP头，4令牌追赶延迟降至0.33 ms。

Oossa · 2026-10-07 · https://oossa.com/zh/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

llama.cpp项目于2026‑10‑07发布b11474版。该版本为模型运行器加入了名为NextN的GLM5‑Next多令牌预测（MTP）计算图。通过在无需输出行时跳过不必要的计算，这项改动将4令牌追赶延迟从6.9 ms降至0.33 ms。此次更新还修复了提取契约，并改进了对部分循环回滚的处理。

## 事实

- b11474版于2026‑10‑07发布（“Wed Oct 07 2026 15:42:20 GMT+0200”）
- 4令牌追赶延迟从6.9 ms降至0.33 ms

## 为什么重要

开发者现在可以更快地运行llama.cpp模型，尤其是在使用依赖多令牌预测的草稿式生成时。

## 来源与参考

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

最后更新: 2026-10-07
