# llama.cpp新增支持多种量化类型的少行数MMA内核

> 2026年10月7日的更新扩展了 Metal 内核，支持 BF16、Q 类型等格式，可加快搭载 Apple M3 Ultra 的设备进行矩阵乘法。

Oossa · 2026-10-07 · https://oossa.com/zh/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

llama.cpp 项目于 2026年10月7日发布 b11476 版本。该版本新增通用的少行数 MMA（矩阵乘加）内核，支持 BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0 以及多种 IQ 格式。该内核在不同的行数门槛下启用：TQ2_0 为 5 行，BF16 为 4 行，MXFP4、Q2_0、Q2_K 和 IQ4_NL 为 3 行，其他格式为 2 行。在 Apple M3 Ultra 上，这些情况下的性能均优于此前的内核。基准测试显示，达到门槛时，操作耗时从 0.23 s 降至 0.98 s，并且在其他行数范围内也有所提速。

## 事实

- b11476 版本于 2026年10月7日发布（“Wed Oct 07 2026 16:55:09 GMT+0200”）。
- 少行数 MMA 内核现已支持 BF16、Q 类型、MXFP4、IQ 类型等，并在 M3 Ultra 上运行更快。

## 为什么重要

使用搭载 M3 Ultra 芯片的 Mac，开发者可以更快运行量化版 Llama 模型，从而缩短应用的推理时间。

## 来源与参考

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

最后更新: 2026-10-07
