llama.cppプロジェクトは2026‑10‑05にバージョン b11430を公開しました。新たに追加されたGGML_HEXAGON_FA_HEAD_SPLITフラグを有効にすると、KVヘッド数がコア数で割り切れる場合、各コアが一部のAttentionヘッドだけを処理します。各コアが読み込むKVキャッシュの量が減り、メモリ帯域をより効率的に利用できます。4コアでのテストでは、Qwen3‑0.6Bが58%、llama‑3.2‑3Bが49%高速化しました。この機能は任意で、新しい–fa-head-splitオプションをrun.pyで指定して利用します。
なぜ重要か
Qualcomm Hexagon搭載ハードウェアでllama.cppを使う開発者は、コードを変更せずに、対応モデルの推論を大幅に高速化できます。