Oossa

llama.cpp、GLM5‑Nextの複数トークン予測に対応し高速化

オープンソースのLLM実行環境が新しいGLM5‑Next MTPヘッドに対応。4トークンの追いつき処理にかかる時間が0.33 msに短縮されました。

短信著者: Oossa公開日: 1 分で読める

llama.cppプロジェクトは2026‑10‑07にバージョンb11474をリリースしました。モデル実行環境に、NextNと呼ばれるGLM5‑Nextの複数トークン予測(MTP)グラフが追加されています。この変更により、出力行が不要な場合に無駄な計算を省けるようになり、4トークンの追いつき処理にかかるレイテンシは6.9 msから0.33 msに短縮されました。また、抽出時のコントラクトに関する修正と、部分的な再帰ロールバックの処理改善も含まれています。

なぜ重要か

複数トークン予測を利用するドラフトベースの生成などで、開発者はllama.cppモデルをより高速に実行できます。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。