Oossa

llama.cpp får GLM5‑Next för flerordsprognoser och högre hastighet

Den öppna LLM-körmiljön har nu stöd för ett nytt GLM5‑Next MTP-huvud, vilket sänker väntetiden vid ikappkörning med 4 token till 0.33 ms.

NotisAv Publicerad av Oossa: 1 min läsning

Projektet llama.cpp släppte version b11474 den 2026‑10‑07. Uppdateringen lägger till en GLM5‑Next-graf för flerordsprognoser (MTP), kallad NextN, i modellkörmiljön. Ändringen gör att koden kan hoppa över onödiga beräkningar när inga utdatarader behövs, vilket sänker väntetiden vid ikappkörning med 4 token från 6.9 ms till 0.33 ms. Uppdateringen rättar även till kontrakt för extrahering och förbättrar hanteringen av partiella återställningar i rekurrenta modeller.

Varför det spelar roll

Utvecklare kan nu köra llama.cpp-modeller snabbare, särskilt vid utkastbaserad generering som bygger på flerordsprognoser.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.