El proyecto llama.cpp publicó la versión b11430 el 2026‑10‑05. Esta incorpora una opción llamada GGML_HEXAGON_FA_HEAD_SPLIT que permite que cada núcleo procese solo un subconjunto de las cabezas de atención cuando el número de cabezas KV se puede dividir uniformemente entre los núcleos. Así, cada núcleo tiene que leer menos caché KV y aprovecha mejor el ancho de banda de memoria. En pruebas con cuatro núcleos, Qwen3‑0.6B logró un aumento de velocidad del 58% y llama‑3.2‑3B, del 49%. El cambio es opcional y se controla con la nueva opción –fa-head-split de run.py.
Por qué importa
Los desarrolladores que ejecutan llama.cpp en hardware Qualcomm Hexagon pueden acelerar notablemente la inferencia en los modelos compatibles sin modificar su código.