Teamet ggml-org publicerade llama.cpp version b11540 den 10 okt. 2026. Uppdateringen lägger till SYCL-stöd för att snabba upp MXFP4-modeller av typen mixture-of-experts (MoE) med aritmetisk avkodning och omordning av vikter. Den innehåller också förbyggda binärfiler för macOS på Apple Silicon, Intel, iOS och flera Ubuntu-varianter (CPU, Vulkan och CUDA). Ändringarna finns listade under taggen b11540 på GitHub.
Varför det spelar roll
Utvecklare kan nu köra större MoE-modeller snabbare på GPU:er med stöd för SYCL, vilket ger användare av llama.cpp fler hårdvarualternativ.