ggml-org 团队于 2026 年 10 月 8 日发布了 llama.cpp b11499 版本。此次更新调整了 CUDA 后端对 roll 操作的处理方式,改用字节步长,让 GPU 能正确处理非连续数据。新版还提供了适用于 Apple Silicon、Intel Mac、iOS 以及多个 Ubuntu 版本的预编译程序,涵盖 CPU、Vulkan 和 CUDA 12。这些文件均可从 GitHub 发布页面下载。
为什么重要
开发者可以在更多 GPU 配置上运行 llama.cpp,避免出错,进一步拓展其在桌面电脑和服务器上的本地大语言模型应用。