# llama.cpp、CUDAのtop-k選択を高速化

> オープンソースのLlama.cppライブラリがCUDAのtop-k選択にradix-selectアルゴリズムを導入。大規模テストで処理時間を5.76秒から0.94秒に短縮しました。

Oossa · 2026-10-08 · https://oossa.com/ja/llama-cpp-adds-faster-cuda-top-k-selection

llama.cppプロジェクトは2026年10月8日、新バージョン（b11513）をリリースしました。従来の行ごとに処理するCUDAのtop-kルーチンを、行をまたいでグリッド処理するradix-selectに置き換えています。Qwen-4-expモデルを34,816トークンで実行した場合、top-kの呼び出し回数は1,671,253回（5,761.8 ms）から2,329回（941.8 ms）に減りました。また、行列の形状に応じて最適なtop-kアルゴリズムを自動選択する機能を追加し、bitonic方式とradix方式のしきい値も調整しています。

## 事実

- リリース日：2026年10月8日 – 「PUBLISHED: Thu Oct 08 2026」
- Qwen-4-expでの処理時間：5,761.8 msから941.8 msに短縮

## なぜ重要か

Nvidia GPUで大規模言語モデルを動かす開発者は、top-k処理の速度が約6倍になり、推論や学習の高速化が期待できます。

## 出典と参考資料

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

最終更新: 2026-10-08
