Oossa

llama.cpp bringt GLM5‑Next-MTP und Tempoverbesserungen

Der Open-Source-LLM-Runner unterstützt jetzt einen neuen GLM5‑Next-MTP-Kopf. Die Aufholzeit für 4 Tokens sinkt damit auf 0,33 ms.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das Projekt llama.cpp hat am 2026‑10‑07 Version b11474 veröffentlicht. Neu ist ein GLM5‑Next-Graph für Multi-Token-Prediction (MTP) namens NextN. Damit kann der Runner unnötige Berechnungen überspringen, wenn keine Ausgabezeilen benötigt werden. Die Aufholzeit für 4 Tokens sinkt dadurch von 6,9 ms auf 0,33 ms. Das Update korrigiert außerdem Extraktionsverträge und verbessert den Umgang mit partiellen Rollbacks rekurrenter Zustände.

Warum es wichtig ist

Entwickler können llama.cpp-Modelle jetzt schneller ausführen – besonders bei einer entwurfsbasierten Generierung, die auf Multi-Token-Prediction setzt.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.