ggml‑org 团队于 2026 年 10 月 8 日发布 llama.cpp b11493 版本。此次更新加入了分组专家混合(MoE)XMX GEMM 的 SYCL 实现。GEMM 是大型语言模型中使用的一种矩阵乘法运算。该版本还附带适用于 macOS、iOS 和 Ubuntu 的预编译二进制文件,涵盖 CPU、Vulkan 和 CUDA。
为什么重要
开发者现在可以在兼容 SYCL 的 GPU 上运行基于 MoE 的模型,为开源大语言模型工作负载提供更多硬件选择。
开源库 llama.cpp 于 2026 年 10 月 8 日发布 b11493 版本,新增基于 SYCL 的分组 MoE XMX GEMM 运算,并提供适用于多个平台的二进制文件。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
ggml‑org 团队于 2026 年 10 月 8 日发布 llama.cpp b11493 版本。此次更新加入了分组专家混合(MoE)XMX GEMM 的 SYCL 实现。GEMM 是大型语言模型中使用的一种矩阵乘法运算。该版本还附带适用于 macOS、iOS 和 Ubuntu 的预编译二进制文件,涵盖 CPU、Vulkan 和 CUDA。
开发者现在可以在兼容 SYCL 的 GPU 上运行基于 MoE 的模型,为开源大语言模型工作负载提供更多硬件选择。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。