Das ggml-org-Team hat llama.cpp b11496 am 8. Okt. 2026 veröffentlicht. Das Update ergänzt eine SYCL-Stufe, die große Modellübertragungen über einen fixierten Ringpuffer abwickelt und so das Laden auf kompatiblen GPUs beschleunigt. Zum Download stehen Binärdateien für macOS (Apple Silicon und Intel), iOS sowie verschiedene Ubuntu-Versionen (CPU, Vulkan, CUDA 12) bereit.
Warum es wichtig ist
Entwickler können große Sprachmodelle auf SYCL-kompatibler Hardware schneller laden und so die Startzeit von Apps verkürzen, die llama.cpp verwenden.