ggml‑orgチームがllama.cppのバージョンb11489をリリースしました。リリースノートによると、今回の更新では、圧縮されたモデルの重みを利用可能な数値に戻す処理であるQ6_Kの重みの復元を高速化し、ループ展開の係数を2倍にしました。Apple Silicon、Intel搭載Mac、iOSに加え、Vulkan版やCUDA版を含む複数のUbuntu環境向けに、ビルド済みバイナリが公開されています。
なぜ重要か
重みの復元が速くなることで、同じハードウェア上でLLMをより低いレイテンシで実行できます。