llama.cpp项目于2026‑10‑05发布b11430版本。该版本新增GGML_HEXAGON_FA_HEAD_SPLIT标志:当KV头数能被核心数整除时,可让每个核心只处理一部分注意力头。这样一来,各核心需要读取的KV缓存就会减少,内存带宽利用率也随之提高。在四核测试中,Qwen3‑0.6B的速度提升了58%,llama‑3.2‑3B则提升了49%。此功能为可选项,可通过run.py中的新选项–fa-head-split启用。
为什么重要
在Qualcomm Hexagon硬件上运行llama.cpp的开发者,无需修改代码,就能让受支持模型的推理速度显著提升。