# llama.cpp b11494 发布，新增 CUDA warp 优化

> 开源库 Llama.cpp 现为每个 CUDA warp 分配 4 列 GDN 状态，提升 GPU 性能。

Oossa · 2026-10-08 · https://oossa.com/zh/llama-cpp-release-b11494-adds-cuda-warp-optimizations

ggml‑org 团队发布了 llama.cpp b11494 版。此次更新将 CUDA 后端每个 warp 分配的 GDN 状态列数从 2 列改为 4 列，并将这一设置设为默认值。macOS（Apple Silicon 和 Intel）、iOS 以及多个 Ubuntu 版本的二进制文件现已开放下载。

## 事实

- 版本标签 b11494 于 2026-10-08 发布
- CUDA 默认 cols_per_warp 值设为 4

## 为什么重要

使用 llama.cpp 在 NVIDIA GPU 上运行的开发者，无需修改代码即可获得更快的推理速度。

## 来源与参考

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

最后更新: 2026-10-08
