# llama.cpp新增按头拆分选项，提升Hexagon闪注速度

> 新增的GGML_HEXAGON_FA_HEAD_SPLIT标志可让受支持模型的多核闪注提速最高58%。

Oossa · 2026-10-05 · https://oossa.com/zh/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

llama.cpp项目于2026‑10‑05发布b11430版本。该版本新增GGML_HEXAGON_FA_HEAD_SPLIT标志：当KV头数能被核心数整除时，可让每个核心只处理一部分注意力头。这样一来，各核心需要读取的KV缓存就会减少，内存带宽利用率也随之提高。在四核测试中，Qwen3‑0.6B的速度提升了58%，llama‑3.2‑3B则提升了49%。此功能为可选项，可通过run.py中的新选项–fa-head-split启用。

## 事实

- 发布日期：2026‑10‑05（“Mon Oct 05 2026 22:38:39 GMT+0200”）
- 提速：Qwen3‑0.6B从6977提升至11026 tokens/s（+58%）

## 为什么重要

在Qualcomm Hexagon硬件上运行llama.cpp的开发者，无需修改代码，就能让受支持模型的推理速度显著提升。

## 来源与参考

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

最后更新: 2026-10-05
