# llama.cpp b11494、CUDAのwarp最適化を追加

> オープンソースのLlama.cppライブラリが、CUDAの各warpでGDNのstate列を4列使うようになり、GPUの性能向上が見込めます。

Oossa · 2026-10-08 · https://oossa.com/ja/llama-cpp-release-b11494-adds-cuda-warp-optimizations

ggml‑orgチームがllama.cppのバージョンb11494をリリースしました。このアップデートではCUDAバックエンドが変更され、各warpに割り当てるGDNのstate列が2列から4列になりました。これが新たなデフォルト設定です。macOS（Apple SiliconおよびIntel）、iOS、複数のUbuntuビルド向けのバイナリをダウンロードできます。

## 事実

- リリースタグb11494は2026-10-08に公開
- CUDAのデフォルト設定cols_per_warpが4に設定

## なぜ重要か

NVIDIA GPUでllama.cppを使う開発者は、コードを変更せずに推論速度の向上を期待できます。

## 出典と参考資料

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

最終更新: 2026-10-08
