llama.cppプロジェクトは2026‑10‑11、バージョンb11554をリリースしました。今回の更新では、行列乗算で重複する行IDを検出し、ループ処理の代わりに事前処理で対応するVulkan向けの修正が加わりました。また、「hoist row ids」最適化を必ず実行するよう改善し、複数のコンパクトなタイルを出力できるようにしました。これにより、GPUが起動するワークグループの数を減らし、可能な場合は早期に処理を終了できます。
なぜ重要か
llama.cppをGPUで使うユーザーは、同じ計算の繰り返しを避けられるため、推論の高速化が期待できます。