Oossa

llama.cpp 为 macOS Metal 新增 Flash Attention 内核

这款开源大语言模型运行时于 2026 年 10 月 9 日发布新版二进制文件,为 Apple Silicon 提供 128/96 位 Flash Attention 支持。

简讯作者: Oossa 发布日期: 1 分钟阅读

ggml‑org 团队于 2026 年 10 月 9 日更新了 llama.cpp(版本 b11518)。此次更新为 Metal 新增了 128 位和 96 位 Flash Attention 内核,可加快 Apple Silicon Mac 上的推理速度。用户可下载适用于 macOS(arm64)、macOS Intel、iOS 以及多种 Linux 配置的预编译二进制文件。

为什么重要

Apple Silicon 用户无需额外购买 GPU 硬件,就能更快地运行大语言模型。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。