Projektet llama.cpp släppte version b11474 den 2026‑10‑07. Uppdateringen lägger till en GLM5‑Next-graf för flerordsprognoser (MTP), kallad NextN, i modellkörmiljön. Ändringen gör att koden kan hoppa över onödiga beräkningar när inga utdatarader behövs, vilket sänker väntetiden vid ikappkörning med 4 token från 6.9 ms till 0.33 ms. Uppdateringen rättar även till kontrakt för extrahering och förbättrar hanteringen av partiella återställningar i rekurrenta modeller.
Varför det spelar roll
Utvecklare kan nu köra llama.cpp-modeller snabbare, särskilt vid utkastbaserad generering som bygger på flerordsprognoser.