Le projet llama.cpp a publié la version b11430 le 2026‑10‑05. Elle ajoute un paramètre, GGML_HEXAGON_FA_HEAD_SPLIT, qui permet à chaque cœur de traiter un sous-ensemble des têtes d’attention lorsque le nombre de têtes KV est divisible par le nombre de cœurs. Chaque cœur doit ainsi lire moins de cache KV, ce qui améliore l’utilisation de la bande passante mémoire. Lors de tests sur quatre cœurs, Qwen3‑0.6B a gagné 58 % en vitesse et llama‑3.2‑3B, 49 %. Cette option est facultative et se règle avec le nouvel argument –fa-head-split dans run.py.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp sur du matériel Qualcomm Hexagon peuvent accélérer sensiblement l’inférence sur les modèles compatibles, sans modifier leur code.