Oossa

llama.cpp新增支持多种量化类型的少行数MMA内核

2026年10月7日的更新扩展了 Metal 内核,支持 BF16、Q 类型等格式,可加快搭载 Apple M3 Ultra 的设备进行矩阵乘法。

简讯作者: Oossa 发布日期: 1 分钟阅读

llama.cpp 项目于 2026年10月7日发布 b11476 版本。该版本新增通用的少行数 MMA(矩阵乘加)内核,支持 BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0 以及多种 IQ 格式。该内核在不同的行数门槛下启用:TQ2_0 为 5 行,BF16 为 4 行,MXFP4、Q2_0、Q2_K 和 IQ4_NL 为 3 行,其他格式为 2 行。在 Apple M3 Ultra 上,这些情况下的性能均优于此前的内核。基准测试显示,达到门槛时,操作耗时从 0.23 s 降至 0.98 s,并且在其他行数范围内也有所提速。

为什么重要

使用搭载 M3 Ultra 芯片的 Mac,开发者可以更快运行量化版 Llama 模型,从而缩短应用的推理时间。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。