# llama.cpp accelera la flash attention su Hexagon con più core

> Il nuovo flag GGML_HEXAGON_FA_HEAD_SPLIT aumenta fino al 58% la velocità della flash attention multi-core sui modelli supportati.

Oossa · 2026-10-05 · https://oossa.com/it/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

Il progetto llama.cpp ha rilasciato la versione b11430 il 2026‑10‑05. Introduce il flag GGML_HEXAGON_FA_HEAD_SPLIT, che consente a ogni core di gestire solo una parte delle teste di attenzione quando il numero di teste KV è divisibile per il numero di core. In questo modo, ogni core deve leggere una quantità minore di cache KV e sfrutta meglio la larghezza di banda della memoria. Nei test condotti su quattro core, Qwen3‑0.6B ha registrato un aumento di velocità del 58% e llama‑3.2‑3B del 49%. La modifica è facoltativa e si attiva con la nuova opzione –fa-head-split in run.py.

## I fatti

- Data di rilascio: 2026‑10‑05 («Mon Oct 05 2026 22:38:39 GMT+0200»)
- Aumento di velocità: Qwen3‑0.6B da 6977 a 11026 token/s (+58%)

## Perché conta

Gli sviluppatori che usano llama.cpp su hardware Qualcomm Hexagon possono ottenere inferenze sensibilmente più veloci sui modelli supportati, senza modificare il codice.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Ultimo aggiornamento: 2026-10-05
