# llama.cpp får stöd för snabbare flash-attention på Hexagon

> Den nya flaggan GGML_HEXAGON_FA_HEAD_SPLIT snabbar upp flash-attention med flera kärnor med upp till 58% på modeller som stöds.

Oossa · 2026-10-05 · https://oossa.com/sv/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

Projektet llama.cpp släppte version b11430 den 2026‑10‑05. Den innehåller flaggan GGML_HEXAGON_FA_HEAD_SPLIT, som gör att varje kärna bara hanterar en del av attention-huvudena när antalet KV-huvuden är jämnt delbart med antalet kärnor. Det minskar mängden KV-cache som varje kärna behöver läsa och förbättrar därmed minnesbandbreddens utnyttjande. I tester med fyra kärnor ökade hastigheten för Qwen3‑0.6B med 58% och för llama‑3.2‑3B med 49%. Funktionen är valfri och styrs med det nya alternativet –fa-head-split i run.py.

## Fakta

- Releasedatum: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- Hastighetsökning: Qwen3‑0.6B 6977 → 11026 tokens/s (+58%)

## Varför det spelar roll

Utvecklare som kör llama.cpp på Qualcomm Hexagon-hårdvara kan få märkbart snabbare inferens med modeller som stöds, utan att ändra sin kod.

## Källor och referenser

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Senast uppdaterad: 2026-10-05
