Oossa

llama.cpp、量子化形式向けの少数行MMAカーネルを追加

2026年10月7日のアップデートでMetalカーネルがBF16やQ系などに対応。Apple M3 Ultra搭載デバイスで行列積を高速化します。

短信著者: Oossa公開日: 1 分で読める

llama.cppプロジェクトは2026年10月7日、バージョンb11476をリリースしました。BF16、Q1_0、Q2_0、MXFP4、Q2_K、Q3_K、TQ2_0および複数のIQ形式に対応する、汎用の少数行MMA(行列積和演算)カーネルが追加されています。このカーネルが有効になる行数は形式によって異なり、TQ2_0は5行、BF16は4行、MXFP4、Q2_0、Q2_K、IQ4_NLは3行、その他は2行です。Apple M3 Ultraでは、これらの行数で従来のカーネルを上回る性能を発揮します。ベンチマークでは、閾値となる行数で処理が0.23秒から0.98秒に高速化し、ほかの行数でも処理時間が改善しています。

なぜ重要か

M3 Ultra搭載Macでは、開発者が量子化Llamaモデルをより高速に実行でき、アプリケーションの推論時間を短縮できます。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。