ggml‑org 团队于 2026-10-09 发布 llama.cpp b11515。此次更新新增基于 SYCL 的 Q5_K 重排布局矩阵乘向量量化(MMVQ)和融合 GLU 算子,可提升兼容硬件上的性能。该版本还附带可直接运行的二进制文件,适用于 Apple Silicon、Intel Mac、iOS、Ubuntu(CPU、Vulkan、CUDA 12.8)和 IBM s390x。用户可从 GitHub 页面下载相应压缩包。
为什么重要
开发者现在无需从源代码构建,就能在兼容 SYCL 的 GPU 上更快地运行 llama.cpp。