Oossa

llama.cpp v0.1.11534、CUDAのコピー処理を最適化

オープンソースのLLaMA推論ライブラリが、GPUメモリの不要なデータ移動をなくし、一部の処理でオーバーヘッドを削減。

短信著者: Oossa公開日: 1 分で読める

ggml-orgチームは2026-10-09、llama.cppのバージョンb11534をリリースした。今回の更新では、状態スナップショットのコピーをrecurrent cacheに統合し、K = 1(投機的デコードを行わないケース)で余分なCUDAコピーを削除した。この変更はCUDAバックエンドに限られ、CPU版とVulkan版には影響しない。macOS、iOS、および複数のUbuntuエディション向けのビルド済みバイナリをダウンロードできる。

CUDA版を使っているユーザーは、GPUメモリのデータ転送量がわずかに減り、対応ハードウェアでは速度が向上する可能性がある。

なぜ重要か

ライブラリがGPU上のデータ移動を減らしたため、CUDAユーザーは推論速度の向上を期待できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。