Das Team von ggml-org hat llama.cpp in Version b11489 veröffentlicht. Das Update beschleunigt die Dekodierung von Q6_K-Gewichten – dabei werden komprimierte Modellgewichte wieder in nutzbare Zahlen umgewandelt – und verdoppelt laut den Versionshinweisen den Unrolling-Faktor. Vorgefertigte Binärdateien sind jetzt für Apple Silicon, Intel-Macs, iOS und verschiedene Ubuntu-Konfigurationen verfügbar, darunter Builds mit Vulkan und CUDA.
Warum es wichtig ist
Durch die schnellere Dekodierung können Entwickler LLMs auf derselben Hardware mit geringerer Latenz ausführen.