# llama.cpp får GLM5‑Next för flerordsprognoser och högre hastighet

> Den öppna LLM-körmiljön har nu stöd för ett nytt GLM5‑Next MTP-huvud, vilket sänker väntetiden vid ikappkörning med 4 token till 0.33 ms.

Oossa · 2026-10-07 · https://oossa.com/sv/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

Projektet llama.cpp släppte version b11474 den 2026‑10‑07. Uppdateringen lägger till en GLM5‑Next-graf för flerordsprognoser (MTP), kallad NextN, i modellkörmiljön. Ändringen gör att koden kan hoppa över onödiga beräkningar när inga utdatarader behövs, vilket sänker väntetiden vid ikappkörning med 4 token från 6.9 ms till 0.33 ms. Uppdateringen rättar även till kontrakt för extrahering och förbättrar hanteringen av partiella återställningar i rekurrenta modeller.

## Fakta

- Version b11474 släpptes den 2026‑10‑07 ("Wed Oct 07 2026 15:42:20 GMT+0200")
- Väntetiden vid ikappkörning med 4 token minskade från 6.9 ms till 0.33 ms

## Varför det spelar roll

Utvecklare kan nu köra llama.cpp-modeller snabbare, särskilt vid utkastbaserad generering som bygger på flerordsprognoser.

## Källor och referenser

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Senast uppdaterad: 2026-10-07
