llama.cpp 项目于 2026年10月7日发布 b11476 版本。该版本新增通用的少行数 MMA(矩阵乘加)内核,支持 BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0 以及多种 IQ 格式。该内核在不同的行数门槛下启用:TQ2_0 为 5 行,BF16 为 4 行,MXFP4、Q2_0、Q2_K 和 IQ4_NL 为 3 行,其他格式为 2 行。在 Apple M3 Ultra 上,这些情况下的性能均优于此前的内核。基准测试显示,达到门槛时,操作耗时从 0.23 s 降至 0.98 s,并且在其他行数范围内也有所提速。
为什么重要
使用搭载 M3 Ultra 芯片的 Mac,开发者可以更快运行量化版 Llama 模型,从而缩短应用的推理时间。