Das Projekt llama.cpp hat am 2026‑10‑07 Version b11474 veröffentlicht. Neu ist ein GLM5‑Next-Graph für Multi-Token-Prediction (MTP) namens NextN. Damit kann der Runner unnötige Berechnungen überspringen, wenn keine Ausgabezeilen benötigt werden. Die Aufholzeit für 4 Tokens sinkt dadurch von 6,9 ms auf 0,33 ms. Das Update korrigiert außerdem Extraktionsverträge und verbessert den Umgang mit partiellen Rollbacks rekurrenter Zustände.
Warum es wichtig ist
Entwickler können llama.cpp-Modelle jetzt schneller ausführen – besonders bei einer entwurfsbasierten Generierung, die auf Multi-Token-Prediction setzt.