Oossa

llama.cpp v b11499 修复 CUDA roll 操作并新增预编译程序

开源大语言模型运行时 llama.cpp 于 2026 年 10 月 8 日发布 b11499 版本,修复 CUDA 对非连续 roll 操作的处理问题,并新增适用于 macOS、iOS 和 Linux 的预编译程序。

简讯作者: Oossa 发布日期: 1 分钟阅读

ggml-org 团队于 2026 年 10 月 8 日发布了 llama.cpp b11499 版本。此次更新调整了 CUDA 后端对 roll 操作的处理方式,改用字节步长,让 GPU 能正确处理非连续数据。新版还提供了适用于 Apple Silicon、Intel Mac、iOS 以及多个 Ubuntu 版本的预编译程序,涵盖 CPU、Vulkan 和 CUDA 12。这些文件均可从 GitHub 发布页面下载。

为什么重要

开发者可以在更多 GPU 配置上运行 llama.cpp,避免出错,进一步拓展其在桌面电脑和服务器上的本地大语言模型应用。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。