# llama.cpp voegt head-split-optie toe voor snellere flash-attention op Hexagon

> De nieuwe GGML_HEXAGON_FA_HEAD_SPLIT-vlag versnelt flash-attention op meerdere cores met maximaal 58% bij ondersteunde modellen.

Oossa · 2026-10-05 · https://oossa.com/nl/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

Het llama.cpp-project bracht versie b11430 uit op 2026‑10‑05. De update voegt een vlag toe met de naam GGML_HEXAGON_FA_HEAD_SPLIT. Daarmee kan elke core slechts een deel van de attention heads verwerken, als het aantal KV-heads gelijkmatig over de cores kan worden verdeeld. Zo hoeft elke core minder KV-cache te lezen en wordt de geheugenbandbreedte efficiënter benut. In tests met vier cores was Qwen3‑0.6B 58% sneller en llama‑3.2‑3B 49% sneller. De wijziging is optioneel en wordt ingesteld met de nieuwe optie –fa-head-split in run.py.

## De feiten

- Releasedatum: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- Snelheidswinst: Qwen3‑0.6B 6977 → 11026 tokens/s (+58%)

## Waarom het ertoe doet

Ontwikkelaars die llama.cpp gebruiken op Qualcomm Hexagon-hardware kunnen ondersteunde modellen merkbaar sneller uitvoeren zonder hun code aan te passen.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Laatst bijgewerkt: 2026-10-05
