# llama.cpp 为 macOS Metal 新增 Flash Attention 内核

> 这款开源大语言模型运行时于 2026 年 10 月 9 日发布新版二进制文件，为 Apple Silicon 提供 128/96 位 Flash Attention 支持。

Oossa · 2026-10-09 · https://oossa.com/zh/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

ggml‑org 团队于 2026 年 10 月 9 日更新了 llama.cpp（版本 b11518）。此次更新为 Metal 新增了 128 位和 96 位 Flash Attention 内核，可加快 Apple Silicon Mac 上的推理速度。用户可下载适用于 macOS（arm64）、macOS Intel、iOS 以及多种 Linux 配置的预编译二进制文件。

## 事实

- 版本标签 b11518 于 2026 年 10 月 9 日（周五）发布
- 为 Apple Silicon 新增 Metal Flash Attention 内核（128/96）

## 为什么重要

Apple Silicon 用户无需额外购买 GPU 硬件，就能更快地运行大语言模型。

## 来源与参考

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

最后更新: 2026-10-09
