Oossa

llama.cpp voegt head-split-optie toe voor snellere flash-attention op Hexagon

De nieuwe GGML_HEXAGON_FA_HEAD_SPLIT-vlag versnelt flash-attention op meerdere cores met maximaal 58% bij ondersteunde modellen.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Het llama.cpp-project bracht versie b11430 uit op 2026‑10‑05. De update voegt een vlag toe met de naam GGML_HEXAGON_FA_HEAD_SPLIT. Daarmee kan elke core slechts een deel van de attention heads verwerken, als het aantal KV-heads gelijkmatig over de cores kan worden verdeeld. Zo hoeft elke core minder KV-cache te lezen en wordt de geheugenbandbreedte efficiënter benut. In tests met vier cores was Qwen3‑0.6B 58% sneller en llama‑3.2‑3B 49% sneller. De wijziging is optioneel en wordt ingesteld met de nieuwe optie –fa-head-split in run.py.

Waarom het ertoe doet

Ontwikkelaars die llama.cpp gebruiken op Qualcomm Hexagon-hardware kunnen ondersteunde modellen merkbaar sneller uitvoeren zonder hun code aan te passen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.