# llama.cpp、量子化形式向けの少数行MMAカーネルを追加

> 2026年10月7日のアップデートでMetalカーネルがBF16やQ系などに対応。Apple M3 Ultra搭載デバイスで行列積を高速化します。

Oossa · 2026-10-07 · https://oossa.com/ja/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

llama.cppプロジェクトは2026年10月7日、バージョンb11476をリリースしました。BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0および複数のIQ形式に対応する、汎用の少数行MMA（行列積和演算）カーネルが追加されています。このカーネルが有効になる行数は形式によって異なり、TQ2_0は5行、BF16は4行、MXFP4、Q2_0、Q2_K、IQ4_NLは3行、その他は2行です。Apple M3 Ultraでは、これらの行数で従来のカーネルを上回る性能を発揮します。ベンチマークでは、閾値となる行数で処理が0.23秒から0.98秒に高速化し、ほかの行数でも処理時間が改善しています。

## 事実

- リリースb11476は2026年10月7日公開（「Wed Oct 07 2026 16:55:09 GMT+0200」）。
- 少数行MMAカーネルがBF16、Q系、MXFP4、IQ形式に対応し、M3 Ultraで高速に動作します。

## なぜ重要か

M3 Ultra搭載Macでは、開発者が量子化Llamaモデルをより高速に実行でき、アプリケーションの推論時間を短縮できます。

## 出典と参考資料

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

最終更新: 2026-10-07
