# llama.cpp acelera la atención flash en Hexagon con una opción de división

> La nueva opción GGML_HEXAGON_FA_HEAD_SPLIT acelera hasta un 58% la atención flash multinúcleo en los modelos compatibles.

Oossa · 2026-10-05 · https://oossa.com/es/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

El proyecto llama.cpp publicó la versión b11430 el 2026‑10‑05. Esta incorpora una opción llamada GGML_HEXAGON_FA_HEAD_SPLIT que permite que cada núcleo procese solo un subconjunto de las cabezas de atención cuando el número de cabezas KV se puede dividir uniformemente entre los núcleos. Así, cada núcleo tiene que leer menos caché KV y aprovecha mejor el ancho de banda de memoria. En pruebas con cuatro núcleos, Qwen3‑0.6B logró un aumento de velocidad del 58% y llama‑3.2‑3B, del 49%. El cambio es opcional y se controla con la nueva opción –fa-head-split de run.py.

## Los hechos

- Fecha de lanzamiento: 2026‑10‑05 («Mon Oct 05 2026 22:38:39 GMT+0200»)
- Aumento de velocidad: Qwen3‑0.6B, de 6977 a 11026 tokens/s (+58%)

## Por qué importa

Los desarrolladores que ejecutan llama.cpp en hardware Qualcomm Hexagon pueden acelerar notablemente la inferencia en los modelos compatibles sin modificar su código.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Última actualización: 2026-10-05
