ggml-orgチームは2026年10月10日、llama.cppのバージョンb11540を公開した。今回のアップデートでは、算術デコードと重みの並べ替えを利用し、MXFP4のMixture of Experts(MoE)モデルを高速化するSYCLサポートが追加された。また、macOS(Apple Silicon、Intel)、iOS、および複数のUbuntu環境(CPU、Vulkan、CUDA)向けのビルド済みバイナリも提供される。変更内容はGitHubのタグb11540に記載されている。
なぜ重要か
SYCLに対応するGPUで、開発者はより大規模なMoEモデルを高速に実行できるようになり、llama.cppで利用できるハードウェアの選択肢が広がる。