オープンソースのllama.cppプロジェクトは、2026年10月11日にバージョンb11558をリリースしました。今回の更新では、Q4_K量子化重みを使う際、OpenCLカーネルがデバイスの画像サイズ上限を超えてしまうバグを修正しています。また、この上限に達するデバイス向けのフォールバック処理を追加し、Q4_0カーネルのブロードキャストとRMSノルムの計算に関する問題も修正しました。これらの変更は、QualcommのHongqiang Wang氏との共同開発によるものです。
なぜ重要か
llama.cppをGPUで使う開発者は、より多くのハードウェアでQ4_K量子化モデルをクラッシュさせずに実行できるようになります。