llama.cppライブラリは2026年10月11日、バージョンb11559をリリースした。OpenCLが改善され、factor allocationの高速化と、Qualcomm E4BおよびE2B GPUでのGemma‑4デコードに対応した。また、さまざまな量子化設定に向けてDK64とDK128のデコード処理も最適化された。変更にはQualcommのHongqiang Wangも共同で取り組んだ。
なぜ重要か
対応するQualcomm GPUでGemma‑4モデルをより高速に実行できるようになり、エッジAIの活用範囲が広がる。