Teamet ggml-org släppte llama.cpp version b11493 den 8 okt. 2026. Uppdateringen lägger till en SYCL-implementation av grupperad Mixture-of-Experts (MoE) XMX GEMM, en matrismultiplikation som används i stora språkmodeller. Versionen innehåller också färdigbyggda binärfiler för macOS, iOS och Ubuntu (CPU, Vulkan och CUDA).
Varför det spelar roll
Utvecklare kan nu köra MoE-baserade modeller på SYCL-kompatibla GPU:er, vilket ger fler hårdvarualternativ för arbetsflöden med öppna LLM:er.