ggml‑org 团队于 2026 年 10 月 10 日发布 llama.cpp b11540 版本。此次更新加入 SYCL 支持,通过算术解码和权重重排加快 MXFP4 混合专家(MoE)模型的运行速度。新版本还提供预编译二进制文件,适用于搭载 Apple Silicon 芯片的 Mac、Intel Mac、iOS,以及多个 Ubuntu 版本(CPU、Vulkan 和 CUDA)。相关改动已列在 GitHub 的 b11540 标签下。
为什么重要
开发者现在可以在支持 SYCL 的 GPU 上更快地运行更大型的 MoE 模型,为 llama.cpp 用户提供更多硬件选择。