Oossa

llama.cpp voegt GLM5‑Next MTP en snelheidsverbeteringen toe

De open-sourcerunner voor LLM’s ondersteunt nu een nieuwe GLM5‑Next MTP-head. De inhaaltijd voor 4 tokens daalt daarmee naar 0.33 ms.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het llama.cpp-project bracht op 2026‑10‑07 versie b11474 uit. Die voegt een GLM5‑Next-graaf voor multi-token prediction (MTP), NextN genaamd, toe aan de modelrunner. Hierdoor kan de code onnodige berekeningen overslaan wanneer er geen uitvoerrijen nodig zijn. De latentie voor het inhalen van 4 tokens daalt zo van 6.9 ms naar 0.33 ms. De update lost ook problemen met extractiecontracten op en verbetert de afhandeling van gedeeltelijke terugdraaiingen van recurrente berekeningen.

Waarom het ertoe doet

Ontwikkelaars kunnen modellen sneller uitvoeren met llama.cpp, vooral bij draft-gebaseerde generatie die gebruikmaakt van multi-token prediction.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.