ggml‑org 团队于 2026 年 10 月 9 日更新了 llama.cpp(版本 b11518)。此次更新为 Metal 新增了 128 位和 96 位 Flash Attention 内核,可加快 Apple Silicon Mac 上的推理速度。用户可下载适用于 macOS(arm64)、macOS Intel、iOS 以及多种 Linux 配置的预编译二进制文件。
为什么重要
Apple Silicon 用户无需额外购买 GPU 硬件,就能更快地运行大语言模型。
这款开源大语言模型运行时于 2026 年 10 月 9 日发布新版二进制文件,为 Apple Silicon 提供 128/96 位 Flash Attention 支持。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
ggml‑org 团队于 2026 年 10 月 9 日更新了 llama.cpp(版本 b11518)。此次更新为 Metal 新增了 128 位和 96 位 Flash Attention 内核,可加快 Apple Silicon Mac 上的推理速度。用户可下载适用于 macOS(arm64)、macOS Intel、iOS 以及多种 Linux 配置的预编译二进制文件。
Apple Silicon 用户无需额外购买 GPU 硬件,就能更快地运行大语言模型。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。