Oossa

llama.cpp、CUDAのtop-k選択を高速化

オープンソースのLlama.cppライブラリがCUDAのtop-k選択にradix-selectアルゴリズムを導入。大規模テストで処理時間を5.76秒から0.94秒に短縮しました。

短信著者: Oossa公開日: 1 分で読める

llama.cppプロジェクトは2026年10月8日、新バージョン(b11513)をリリースしました。従来の行ごとに処理するCUDAのtop-kルーチンを、行をまたいでグリッド処理するradix-selectに置き換えています。Qwen-4-expモデルを34,816トークンで実行した場合、top-kの呼び出し回数は1,671,253回(5,761.8 ms)から2,329回(941.8 ms)に減りました。また、行列の形状に応じて最適なtop-kアルゴリズムを自動選択する機能を追加し、bitonic方式とradix方式のしきい値も調整しています。

なぜ重要か

Nvidia GPUで大規模言語モデルを動かす開発者は、top-k処理の速度が約6倍になり、推論や学習の高速化が期待できます。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。