Oossa

llama.cpp b11510 新增 CUDA 支持,可处理更多张量行

这款开源 LLaMA 推理库发布 b11510 版,新增可处理超过 65,535 行的 CUDA 内核,并提供适用于 macOS、iOS 和 Linux 的二进制文件。

简讯作者: Oossa 发布日期: 1 分钟阅读

ggml-org 团队于 2026 年 10 月 8 日发布 llama.cpp b11510 版。新版本为 CUDA 增加了循环式 PAD 内核,让该库能够处理行数或切片数超过 65,000 的张量。此版本还附带预编译二进制文件,适用于 Apple Silicon、Intel Mac、iOS,以及多个 Ubuntu 版本(CPU、Vulkan 和 CUDA 12.8)。代码和证明材料可通过 GitHub 页面获取。

为什么重要

开发者现在可以在 NVIDIA GPU 上运行更大的语言模型,不再受此前行数上限的限制。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。