Het ggml-org-team publiceerde op 10 okt. 2026 versie b11540 van llama.cpp. De update voegt SYCL-ondersteuning toe om MXFP4-mixture-of-expertsmodellen (MoE) sneller te maken met behulp van rekenkundige decodering en het herschikken van gewichten. Ook bevat de release vooraf gebouwde binaries voor Apple Silicon en Intel-Macs, iOS en verschillende Ubuntu-varianten (CPU, Vulkan en CUDA). De wijzigingen staan op GitHub vermeld onder de tag b11540.
Waarom het ertoe doet
Ontwikkelaars kunnen nu grotere MoE-modellen sneller uitvoeren op GPU's met SYCL-ondersteuning, waardoor gebruikers van llama.cpp meer hardwareopties hebben.