# llama.cpp acelera atenção flash no Hexagon com nova opção

> A nova flag GGML_HEXAGON_FA_HEAD_SPLIT acelera em até 58% a atenção flash em vários núcleos, nos modelos compatíveis.

Oossa · 2026-10-05 · https://oossa.com/pt/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

O projeto llama.cpp lançou a versão b11430 em 2026‑10‑05. Ela adiciona a flag GGML_HEXAGON_FA_HEAD_SPLIT, que permite que cada núcleo processe apenas um subconjunto das cabeças de atenção quando o número de cabeças KV é divisível pelo número de núcleos. Isso reduz a quantidade de cache KV que cada núcleo precisa ler e melhora o uso da largura de banda da memória. Em testes com quatro núcleos, o Qwen3‑0.6B teve um ganho de velocidade de 58%, e o llama‑3.2‑3B, de 49%. A mudança é opcional e pode ser ativada pela nova opção –fa-head-split no run.py.

## Os fatos

- Data de lançamento: 2026‑10‑05 ("Mon Oct 05 2026 22:38:39 GMT+0200")
- Ganho de velocidade: Qwen3‑0.6B, 6977 → 11026 tokens/s (+58%)

## Por que importa

Desenvolvedores que usam llama.cpp em hardware Qualcomm Hexagon podem obter inferência consideravelmente mais rápida em modelos compatíveis, sem alterar o código.

## Fontes e referências

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Última atualização: 2026-10-05
