llama.cppプロジェクトは2026‑10‑07にバージョンb11474をリリースしました。モデル実行環境に、NextNと呼ばれるGLM5‑Nextの複数トークン予測(MTP)グラフが追加されています。この変更により、出力行が不要な場合に無駄な計算を省けるようになり、4トークンの追いつき処理にかかるレイテンシは6.9 msから0.33 msに短縮されました。また、抽出時のコントラクトに関する修正と、部分的な再帰ロールバックの処理改善も含まれています。
なぜ重要か
複数トークン予測を利用するドラフトベースの生成などで、開発者はllama.cppモデルをより高速に実行できます。