Das llama.cpp-Projekt hat am 2026‑10‑05 Version b11430 veröffentlicht. Sie enthält die Option GGML_HEXAGON_FA_HEAD_SPLIT. Damit verarbeitet jeder Kern nur einen Teil der Attention-Heads, sofern sich die Anzahl der KV-Heads gleichmäßig auf die Kerne verteilen lässt. Dadurch muss jeder Kern weniger KV-Cache lesen, was die Speicherbandbreite effizienter nutzt. In Tests mit vier Kernen war Qwen3‑0.6B um 58 Prozent schneller, llama‑3.2‑3B um 49 Prozent. Die Änderung ist optional und wird über die neue Option –fa-head-split in run.py aktiviert.
Warum es wichtig ist
Entwickler, die llama.cpp auf Qualcomm-Hexagon-Hardware nutzen, können unterstützte Modelle deutlich schneller ausführen, ohne ihren Code ändern zu müssen.