ggml-org 团队于 2026 年 10 月 8 日发布 llama.cpp b11510 版。新版本为 CUDA 增加了循环式 PAD 内核,让该库能够处理行数或切片数超过 65,000 的张量。此版本还附带预编译二进制文件,适用于 Apple Silicon、Intel Mac、iOS,以及多个 Ubuntu 版本(CPU、Vulkan 和 CUDA 12.8)。代码和证明材料可通过 GitHub 页面获取。
为什么重要
开发者现在可以在 NVIDIA GPU 上运行更大的语言模型,不再受此前行数上限的限制。