# llama.cpp beschleunigt Flash-Attention auf Hexagon durch Kopfaufteilung

> Die neue GGML_HEXAGON_FA_HEAD_SPLIT-Option beschleunigt Flash-Attention über mehrere Kerne bei unterstützten Modellen um bis zu 58 Prozent.

Oossa · 2026-10-05 · https://oossa.com/de/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

Das llama.cpp-Projekt hat am 2026‑10‑05 Version b11430 veröffentlicht. Sie enthält die Option GGML_HEXAGON_FA_HEAD_SPLIT. Damit verarbeitet jeder Kern nur einen Teil der Attention-Heads, sofern sich die Anzahl der KV-Heads gleichmäßig auf die Kerne verteilen lässt. Dadurch muss jeder Kern weniger KV-Cache lesen, was die Speicherbandbreite effizienter nutzt. In Tests mit vier Kernen war Qwen3‑0.6B um 58 Prozent schneller, llama‑3.2‑3B um 49 Prozent. Die Änderung ist optional und wird über die neue Option –fa-head-split in run.py aktiviert.

## Die Fakten

- Veröffentlichungsdatum: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- Leistungssteigerung: Qwen3‑0.6B 6977 → 11026 Tokens/s (+58 %)

## Warum es wichtig ist

Entwickler, die llama.cpp auf Qualcomm-Hexagon-Hardware nutzen, können unterstützte Modelle deutlich schneller ausführen, ohne ihren Code ändern zu müssen.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Zuletzt aktualisiert: 2026-10-05
