Het team van ggml-org publiceerde llama.cpp b11496 op 8 okt. 2026. De update voegt een SYCL-fase toe die grote modeluploads via een gepinde ringbuffer verwerkt, waardoor het laden op compatibele GPU’s sneller gaat. Binaries voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-builds (CPU, Vulkan, CUDA 12) zijn te downloaden.
Waarom het ertoe doet
Ontwikkelaars kunnen grote taalmodellen sneller laden op hardware die compatibel is met SYCL. Daardoor starten apps die llama.cpp gebruiken sneller op.