llama.cpp 项目于 2026 年 10 月 9 日发布了名为 b11517 的新预发布版。此次更新新增一项 CUDA 选项,用户可通过它为 MMQ 辅助函数(一项 GPU 代码底层组件)指定 source-1 精度。该改动由一位 NVIDIA 贡献者签署,适用于列出的 Linux 和 Windows CUDA 12、CUDA 13 构建版本。此次发布还包含许多其他平台的构建目标,涵盖搭载 Apple Silicon 的 macOS 设备以及 Android Snapdragon 设备。
此次更新可从项目的 GitHub 页面和 llama.app 网站获取。
为什么重要
开发者现在可以控制 llama.cpp 的 GPU 精度,这可能有助于提升运行 LLaMA 模型时的性能或减少内存占用。