llama.cppプロジェクトは2026年10月8日、新バージョン(b11513)をリリースしました。従来の行ごとに処理するCUDAのtop-kルーチンを、行をまたいでグリッド処理するradix-selectに置き換えています。Qwen-4-expモデルを34,816トークンで実行した場合、top-kの呼び出し回数は1,671,253回(5,761.8 ms)から2,329回(941.8 ms)に減りました。また、行列の形状に応じて最適なtop-kアルゴリズムを自動選択する機能を追加し、bitonic方式とradix方式のしきい値も調整しています。
なぜ重要か
Nvidia GPUで大規模言語モデルを動かす開発者は、top-k処理の速度が約6倍になり、推論や学習の高速化が期待できます。