OossaAI 发展迅速。我们用简单的话讲清楚。

llama.cpp 更新提升 MoE 矩阵乘法效率

2026 年 9 月 30 日发布的更新调整了 Vulkan 分块选择,减少混合专家模型中的无效计算。

简讯Oossa1 分钟阅读

开源库 llama.cpp 为支持 MoE 的矩阵乘法加入了一项 Vulkan 修复。此次改动调整了代码为 mat_mul_id 操作选择分块大小的方式,使其与每位专家实际激活的行数相匹配。在一项针对 300 亿参数模型的测试中,这项修复减少了 GPU 空转;此前空转占运行时间的 55%。

为什么重要

减少 GPU 空转时间,意味着在兼容 Vulkan 的硬件上运行大型 MoE 模型时,推理速度更快。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。

来源与参考

#来源发布方日期要点
1ggml-org/llama.cpp b11265 ↗llama.cpp2026年9月29日<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 个来源

最后更新: ·Markdown·llms.txt