ggml-orgチームは2026-10-09、llama.cppのバージョンb11534をリリースした。今回の更新では、状態スナップショットのコピーをrecurrent cacheに統合し、K = 1(投機的デコードを行わないケース)で余分なCUDAコピーを削除した。この変更はCUDAバックエンドに限られ、CPU版とVulkan版には影響しない。macOS、iOS、および複数のUbuntuエディション向けのビルド済みバイナリをダウンロードできる。
CUDA版を使っているユーザーは、GPUメモリのデータ転送量がわずかに減り、対応ハードウェアでは速度が向上する可能性がある。
なぜ重要か
ライブラリがGPU上のデータ移動を減らしたため、CUDAユーザーは推論速度の向上を期待できる。