Het llama.cpp-project bracht op 2026‑10‑07 versie b11474 uit. Die voegt een GLM5‑Next-graaf voor multi-token prediction (MTP), NextN genaamd, toe aan de modelrunner. Hierdoor kan de code onnodige berekeningen overslaan wanneer er geen uitvoerrijen nodig zijn. De latentie voor het inhalen van 4 tokens daalt zo van 6.9 ms naar 0.33 ms. De update lost ook problemen met extractiecontracten op en verbetert de afhandeling van gedeeltelijke terugdraaiingen van recurrente berekeningen.
Waarom het ertoe doet
Ontwikkelaars kunnen modellen sneller uitvoeren met llama.cpp, vooral bij draft-gebaseerde generatie die gebruikmaakt van multi-token prediction.