# llama.cpp、GLM5‑Nextの複数トークン予測に対応し高速化

> オープンソースのLLM実行環境が新しいGLM5‑Next MTPヘッドに対応。4トークンの追いつき処理にかかる時間が0.33 msに短縮されました。

Oossa · 2026-10-07 · https://oossa.com/ja/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

llama.cppプロジェクトは2026‑10‑07にバージョンb11474をリリースしました。モデル実行環境に、NextNと呼ばれるGLM5‑Nextの複数トークン予測（MTP）グラフが追加されています。この変更により、出力行が不要な場合に無駄な計算を省けるようになり、4トークンの追いつき処理にかかるレイテンシは6.9 msから0.33 msに短縮されました。また、抽出時のコントラクトに関する修正と、部分的な再帰ロールバックの処理改善も含まれています。

## 事実

- バージョンb11474は2026‑10‑07にリリース（「Wed Oct 07 2026 15:42:20 GMT+0200」）
- 4トークンの追いつき処理にかかるレイテンシは6.9 msから0.33 msに短縮

## なぜ重要か

複数トークン予測を利用するドラフトベースの生成などで、開発者はllama.cppモデルをより高速に実行できます。

## 出典と参考資料

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

最終更新: 2026-10-07
