# llama.cpp、HexagonのFlash Attentionを最大58％高速化

> 新しいGGML_HEXAGON_FA_HEAD_SPLITフラグにより、対応モデルではマルチコアのFlash Attentionが最大58％高速になります。

Oossa · 2026-10-05 · https://oossa.com/ja/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

llama.cppプロジェクトは2026‑10‑05にバージョン b11430を公開しました。新たに追加されたGGML_HEXAGON_FA_HEAD_SPLITフラグを有効にすると、KVヘッド数がコア数で割り切れる場合、各コアが一部のAttentionヘッドだけを処理します。各コアが読み込むKVキャッシュの量が減り、メモリ帯域をより効率的に利用できます。4コアでのテストでは、Qwen3‑0.6Bが58％、llama‑3.2‑3Bが49％高速化しました。この機能は任意で、新しい–fa-head-splitオプションをrun.pyで指定して利用します。

## 事実

- リリース日：2026‑10‑05（「Mon Oct 05 2026 22:38:39 GMT+0200」）
- 速度向上：Qwen3‑0.6Bは6977 → 11026 tokens/s（+58％）

## なぜ重要か

Qualcomm Hexagon搭載ハードウェアでllama.cppを使う開発者は、コードを変更せずに、対応モデルの推論を大幅に高速化できます。

## 出典と参考資料

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

最終更新: 2026-10-05
