# llama.cpp accélère l’attention flash sur Hexagon avec le découpage des têtes

> Le nouveau paramètre GGML_HEXAGON_FA_HEAD_SPLIT accélère jusqu’à 58 % l’attention flash multicœur sur les modèles compatibles.

Oossa · 2026-10-05 · https://oossa.com/fr/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

Le projet llama.cpp a publié la version b11430 le 2026‑10‑05. Elle ajoute un paramètre, GGML_HEXAGON_FA_HEAD_SPLIT, qui permet à chaque cœur de traiter un sous-ensemble des têtes d’attention lorsque le nombre de têtes KV est divisible par le nombre de cœurs. Chaque cœur doit ainsi lire moins de cache KV, ce qui améliore l’utilisation de la bande passante mémoire. Lors de tests sur quatre cœurs, Qwen3‑0.6B a gagné 58 % en vitesse et llama‑3.2‑3B, 49 %. Cette option est facultative et se règle avec le nouvel argument –fa-head-split dans run.py.

## Les faits

- Date de sortie : 2026‑10‑05 (« Mon Oct 05 2026 22:38:39 GMT+0200 »)
- Gain de vitesse : Qwen3‑0.6B, 6977 → 11026 tokens/s (+58 %)

## Pourquoi c'est important

Les développeurs qui utilisent llama.cpp sur du matériel Qualcomm Hexagon peuvent accélérer sensiblement l’inférence sur les modèles compatibles, sans modifier leur code.

## Sources et références

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Dernière mise à jour: 2026-10-05
