Das Team von ggml-org hat am 9. Okt. 2026 llama.cpp Version b11528 veröffentlicht. Mit dem Update behandelt die Bibliothek Ansichten hostallokierter Tensoren wie normale Knoten. Dadurch wird ein früherer Assertion-Fehler verhindert, der bei der Option –split-mode tensor auftrat. Außerdem wird die SM-Tensor-Unterstützung für den Beschleuniger K2 Horizon wieder eingeführt. Die Änderung ist im offiziellen GitHub-Release enthalten und gilt für alle aufgeführten Plattformen – von macOS bis Windows und Linux.
Warum es wichtig ist
Entwickler können llama.cpp nun mit aufgeteiltem KV-Cache auf mehr Hardware ohne Abstürze nutzen. Dadurch stehen für die lokale LLM-Inferenz mehr Konfigurationen zur Verfügung.