# llama.cpp b11510 新增 CUDA 支持，可处理更多张量行

> 这款开源 LLaMA 推理库发布 b11510 版，新增可处理超过 65,535 行的 CUDA 内核，并提供适用于 macOS、iOS 和 Linux 的二进制文件。

Oossa · 2026-10-08 · https://oossa.com/zh/llama-cpp-b11510-adds-cuda-support-for-larger-tensors

ggml-org 团队于 2026 年 10 月 8 日发布 llama.cpp b11510 版。新版本为 CUDA 增加了循环式 PAD 内核，让该库能够处理行数或切片数超过 65,000 的张量。此版本还附带预编译二进制文件，适用于 Apple Silicon、Intel Mac、iOS，以及多个 Ubuntu 版本（CPU、Vulkan 和 CUDA 12.8）。代码和证明材料可通过 GitHub 页面获取。

## 事实

- b11510 版于 2026-10-08 发布
- 新增的 CUDA PAD 内核支持超过 65535 行

## 为什么重要

开发者现在可以在 NVIDIA GPU 上运行更大的语言模型，不再受此前行数上限的限制。

## 来源与参考

1. [ggml-org/llama.cpp b11510](https://github.com/ggml-org/llama.cpp/releases/tag/b11510) – llama.cpp, 2026-10-08

最后更新: 2026-10-08
