# llama.cpp bringt GLM5‑Next-MTP und Tempoverbesserungen

> Der Open-Source-LLM-Runner unterstützt jetzt einen neuen GLM5‑Next-MTP-Kopf. Die Aufholzeit für 4 Tokens sinkt damit auf 0,33 ms.

Oossa · 2026-10-07 · https://oossa.com/de/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

Das Projekt llama.cpp hat am 2026‑10‑07 Version b11474 veröffentlicht. Neu ist ein GLM5‑Next-Graph für Multi-Token-Prediction (MTP) namens NextN. Damit kann der Runner unnötige Berechnungen überspringen, wenn keine Ausgabezeilen benötigt werden. Die Aufholzeit für 4 Tokens sinkt dadurch von 6,9 ms auf 0,33 ms. Das Update korrigiert außerdem Extraktionsverträge und verbessert den Umgang mit partiellen Rollbacks rekurrenter Zustände.

## Die Fakten

- Version b11474 veröffentlicht am 2026‑10‑07 ("Wed Oct 07 2026 15:42:20 GMT+0200")
- Aufholzeit für 4 Tokens von 6,9 ms auf 0,33 ms gesenkt

## Warum es wichtig ist

Entwickler können llama.cpp-Modelle jetzt schneller ausführen – besonders bei einer entwurfsbasierten Generierung, die auf Multi-Token-Prediction setzt.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Zuletzt aktualisiert: 2026-10-07
