Oossa

llama.cpp、HexagonのFlash Attentionを最大58%高速化

新しいGGML_HEXAGON_FA_HEAD_SPLITフラグにより、対応モデルではマルチコアのFlash Attentionが最大58%高速になります。

短信OossaOossa公開日: 1 分で読める

llama.cppプロジェクトは2026‑10‑05にバージョン b11430を公開しました。新たに追加されたGGML_HEXAGON_FA_HEAD_SPLITフラグを有効にすると、KVヘッド数がコア数で割り切れる場合、各コアが一部のAttentionヘッドだけを処理します。各コアが読み込むKVキャッシュの量が減り、メモリ帯域をより効率的に利用できます。4コアでのテストでは、Qwen3‑0.6Bが58%、llama‑3.2‑3Bが49%高速化しました。この機能は任意で、新しい–fa-head-splitオプションをrun.pyで指定して利用します。

なぜ重要か

Qualcomm Hexagon搭載ハードウェアでllama.cppを使う開発者は、コードを変更せずに、対応モデルの推論を大幅に高速化できます。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。