Das Team von ggml-org hat am 2026-10-09 llama.cpp Release b11515 veröffentlicht. Das Update ergänzt eine SYCL-basierte Q5_K-Layout-Umordnung für Matrix-Vektor-Multiplikation mit Quantisierung (MMVQ) sowie einen fusionierten GLU-Operator. Das verbessert die Leistung auf kompatibler Hardware. Außerdem enthält das Release sofort nutzbare Binärdateien für Apple Silicon, Intel-Macs, iOS, Ubuntu (CPU, Vulkan, CUDA 12.8) und IBM s390x. Das passende Archiv können Nutzer von der GitHub-Seite herunterladen.
Warum es wichtig ist
Entwickler können llama.cpp jetzt auf SYCL-kompatiblen GPUs schneller ausführen, ohne das Programm selbst kompilieren zu müssen.