Het ggml‑org-team bracht op 8 oktober 2026 versie b11493 van llama.cpp uit. De update voegt een SYCL-implementatie toe van grouped Mixture-of-Experts (MoE) XMX GEMM, een matrixvermenigvuldiging die in grote taalmodellen wordt gebruikt. De release bevat ook vooraf gebouwde binaries voor macOS, iOS en Ubuntu (CPU, Vulkan en CUDA).
Waarom het ertoe doet
Ontwikkelaars kunnen MoE-modellen nu uitvoeren op GPU’s die compatibel zijn met SYCL, waardoor er meer hardwareopties beschikbaar komen voor opensource-LLM-workloads.