# llama.cpp v0.1.11534、CUDAのコピー処理を最適化

> オープンソースのLLaMA推論ライブラリが、GPUメモリの不要なデータ移動をなくし、一部の処理でオーバーヘッドを削減。

Oossa · 2026-10-09 · https://oossa.com/ja/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

ggml-orgチームは2026-10-09、llama.cppのバージョンb11534をリリースした。今回の更新では、状態スナップショットのコピーをrecurrent cacheに統合し、K = 1（投機的デコードを行わないケース）で余分なCUDAコピーを削除した。この変更はCUDAバックエンドに限られ、CPU版とVulkan版には影響しない。macOS、iOS、および複数のUbuntuエディション向けのビルド済みバイナリをダウンロードできる。

CUDA版を使っているユーザーは、GPUメモリのデータ転送量がわずかに減り、対応ハードウェアでは速度が向上する可能性がある。

## 事実

- バージョンb11534は2026-10-09に公開
- CUDAコピーの削除はK = 1（投機的デコードなし）のケースに適用

## なぜ重要か

ライブラリがGPU上のデータ移動を減らしたため、CUDAユーザーは推論速度の向上を期待できる。

## 出典と参考資料

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

最終更新: 2026-10-09
