Het llama.cpp-project bracht versie b11430 uit op 2026‑10‑05. De update voegt een vlag toe met de naam GGML_HEXAGON_FA_HEAD_SPLIT. Daarmee kan elke core slechts een deel van de attention heads verwerken, als het aantal KV-heads gelijkmatig over de cores kan worden verdeeld. Zo hoeft elke core minder KV-cache te lezen en wordt de geheugenbandbreedte efficiënter benut. In tests met vier cores was Qwen3‑0.6B 58% sneller en llama‑3.2‑3B 49% sneller. De wijziging is optioneel en wordt ingesteld met de nieuwe optie –fa-head-split in run.py.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp gebruiken op Qualcomm Hexagon-hardware kunnen ondersteunde modellen merkbaar sneller uitvoeren zonder hun code aan te passen.