llama.cppプロジェクトは2026年9月30日、新バージョンを公開した。新しい言語モデルアーキテクチャのGLM‑5.3‑Flash(GLM5‑Nextとも呼ばれる)に対応したほか、計算バッファーのサイズを縮小し、長いコンテキストのデコードを高速化。トークン処理やGPUメモリーに関する複数のバグも修正した。今回の変更は、CPUやGPUでLLMをローカル実行する開発者を対象としている。
なぜ重要か
最新のGLMモデルを、ユーザー自身のハードウェアでより高速に、少ないメモリーで実行できるようになる。