Oossa

llama.cpp新增按头拆分选项,提升Hexagon闪注速度

新增的GGML_HEXAGON_FA_HEAD_SPLIT标志可让受支持模型的多核闪注提速最高58%。

简讯OossaOossa 发布日期: 1 分钟阅读

llama.cpp项目于2026‑10‑05发布b11430版本。该版本新增GGML_HEXAGON_FA_HEAD_SPLIT标志:当KV头数能被核心数整除时,可让每个核心只处理一部分注意力头。这样一来,各核心需要读取的KV缓存就会减少,内存带宽利用率也随之提高。在四核测试中,Qwen3‑0.6B的速度提升了58%,llama‑3.2‑3B则提升了49%。此功能为可选项,可通过run.py中的新选项–fa-head-split启用。

为什么重要

在Qualcomm Hexagon硬件上运行llama.cpp的开发者,无需修改代码,就能让受支持模型的推理速度显著提升。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。