llama.cppプロジェクトは2026年10月7日、バージョンb11476をリリースしました。BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0および複数のIQ形式に対応する、汎用の少数行MMA(行列積和演算)カーネルが追加されています。このカーネルが有効になる行数は形式によって異なり、TQ2_0は5行、BF16は4行、MXFP4、Q2_0、Q2_K、IQ4_NLは3行、その他は2行です。Apple M3 Ultraでは、これらの行数で従来のカーネルを上回る性能を発揮します。ベンチマークでは、閾値となる行数で処理が0.23秒から0.98秒に高速化し、ほかの行数でも処理時間が改善しています。
なぜ重要か
M3 Ultra搭載Macでは、開発者が量子化Llamaモデルをより高速に実行でき、アプリケーションの推論時間を短縮できます。