Oossa

llama.cpp accélère l’attention flash sur Hexagon avec le découpage des têtes

Le nouveau paramètre GGML_HEXAGON_FA_HEAD_SPLIT accélère jusqu’à 58 % l’attention flash multicœur sur les modèles compatibles.

BrèveOossaPublié par Oossa: 1 min de lecture

Le projet llama.cpp a publié la version b11430 le 2026‑10‑05. Elle ajoute un paramètre, GGML_HEXAGON_FA_HEAD_SPLIT, qui permet à chaque cœur de traiter un sous-ensemble des têtes d’attention lorsque le nombre de têtes KV est divisible par le nombre de cœurs. Chaque cœur doit ainsi lire moins de cache KV, ce qui améliore l’utilisation de la bande passante mémoire. Lors de tests sur quatre cœurs, Qwen3‑0.6B a gagné 58 % en vitesse et llama‑3.2‑3B, 49 %. Cette option est facultative et se règle avec le nouvel argument –fa-head-split dans run.py.

Pourquoi c'est important

Les développeurs qui utilisent llama.cpp sur du matériel Qualcomm Hexagon peuvent accélérer sensiblement l’inférence sur les modèles compatibles, sans modifier leur code.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.