# llama.cpp v b11499 修复 CUDA roll 操作并新增预编译程序

> 开源大语言模型运行时 llama.cpp 于 2026 年 10 月 8 日发布 b11499 版本，修复 CUDA 对非连续 roll 操作的处理问题，并新增适用于 macOS、iOS 和 Linux 的预编译程序。

Oossa · 2026-10-08 · https://oossa.com/zh/llama-cpp-v-b11499-adds-cuda-roll-improvement-and-new-binaries

ggml-org 团队于 2026 年 10 月 8 日发布了 llama.cpp b11499 版本。此次更新调整了 CUDA 后端对 roll 操作的处理方式，改用字节步长，让 GPU 能正确处理非连续数据。新版还提供了适用于 Apple Silicon、Intel Mac、iOS 以及多个 Ubuntu 版本的预编译程序，涵盖 CPU、Vulkan 和 CUDA 12。这些文件均可从 GitHub 发布页面下载。

## 事实

- b11499 版本于 2026 年 10 月 8 日发布
- CUDA 后端现已支持采用字节步长的 roll 操作

## 为什么重要

开发者可以在更多 GPU 配置上运行 llama.cpp，避免出错，进一步拓展其在桌面电脑和服务器上的本地大语言模型应用。

## 来源与参考

1. [ggml-org/llama.cpp b11499](https://github.com/ggml-org/llama.cpp/releases/tag/b11499) – llama.cpp, 2026-10-08

最后更新: 2026-10-08
