llama.cppプロジェクトは2026年10月8日、バージョンb11482をリリースしました。幅512を超えるブロックに対応するCUDA FWHTカーネルが追加され、FP32とFP16の両方で幅1,024〜8,192を処理できるようになりました。この変更では既存のF16基盤を再利用しており、A10 GPUでテストに合格しています。既存のワープ幅カーネル(64〜512)に変更はありません。
なぜ重要か
GPUユーザーは、llama.cppでより幅の大きい行列乗算をより高速に実行できるようになります。