Oossa

llama.cpp får stöd för snabbare flash-attention på Hexagon

Den nya flaggan GGML_HEXAGON_FA_HEAD_SPLIT snabbar upp flash-attention med flera kärnor med upp till 58% på modeller som stöds.

NotisOossaPublicerad av Oossa: 1 min läsning

Projektet llama.cpp släppte version b11430 den 2026‑10‑05. Den innehåller flaggan GGML_HEXAGON_FA_HEAD_SPLIT, som gör att varje kärna bara hanterar en del av attention-huvudena när antalet KV-huvuden är jämnt delbart med antalet kärnor. Det minskar mängden KV-cache som varje kärna behöver läsa och förbättrar därmed minnesbandbreddens utnyttjande. I tester med fyra kärnor ökade hastigheten för Qwen3‑0.6B med 58% och för llama‑3.2‑3B med 49%. Funktionen är valfri och styrs med det nya alternativet –fa-head-split i run.py.

Varför det spelar roll

Utvecklare som kör llama.cpp på Qualcomm Hexagon-hårdvara kan få märkbart snabbare inferens med modeller som stöds, utan att ändra sin kod.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.