# llama.cpp voegt GLM5‑Next MTP en snelheidsverbeteringen toe

> De open-sourcerunner voor LLM’s ondersteunt nu een nieuwe GLM5‑Next MTP-head. De inhaaltijd voor 4 tokens daalt daarmee naar 0.33 ms.

Oossa · 2026-10-07 · https://oossa.com/nl/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

Het llama.cpp-project bracht op 2026‑10‑07 versie b11474 uit. Die voegt een GLM5‑Next-graaf voor multi-token prediction (MTP), NextN genaamd, toe aan de modelrunner. Hierdoor kan de code onnodige berekeningen overslaan wanneer er geen uitvoerrijen nodig zijn. De latentie voor het inhalen van 4 tokens daalt zo van 6.9 ms naar 0.33 ms. De update lost ook problemen met extractiecontracten op en verbetert de afhandeling van gedeeltelijke terugdraaiingen van recurrente berekeningen.

## De feiten

- Versie b11474 uitgebracht op 2026‑10‑07 ("Wed Oct 07 2026 15:42:20 GMT+0200")
- Latentie voor het inhalen van 4 tokens daalt van 6.9 ms naar 0.33 ms

## Waarom het ertoe doet

Ontwikkelaars kunnen modellen sneller uitvoeren met llama.cpp, vooral bij draft-gebaseerde generatie die gebruikmaakt van multi-token prediction.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Laatst bijgewerkt: 2026-10-07
