# llama.cpp ускоряет flash-attention на Hexagon благодаря разделению голов

> Новый флаг GGML_HEXAGON_FA_HEAD_SPLIT ускоряет flash-attention на нескольких ядрах до 58% в поддерживаемых моделях.

Oossa · 2026-10-05 · https://oossa.com/ru/llama-cpp-adds-head-split-option-for-faster-flash-attention-on-hexagon

Проект llama.cpp выпустил версию b11430 2026‑10‑05. В ней появился флаг GGML_HEXAGON_FA_HEAD_SPLIT: он позволяет каждому ядру обрабатывать только часть голов внимания, если число KV-голов делится на число ядер без остатка. Благодаря этому каждому ядру нужно считывать меньше данных из KV-кэша, что повышает эффективность использования пропускной способности памяти. В тестах на четырёх ядрах Qwen3‑0.6B показала прирост скорости на 58%, а llama‑3.2‑3B — на 49%. Функция необязательная и включается новым параметром –fa-head-split в run.py.

## Факты

- Дата выпуска: 2026‑10‑05 («Mon Oct 05 2026 22:38:39 GMT+0200»)
- Ускорение: Qwen3‑0.6B — 6977 → 11026 токенов/с (+58%)

## Почему это важно

Разработчики, использующие llama.cpp на оборудовании Qualcomm Hexagon, могут заметно ускорить работу поддерживаемых моделей, не меняя код.

## Источники и ссылки

1. [ggml-org/llama.cpp b11430](https://github.com/ggml-org/llama.cpp/releases/tag/b11430) – llama.cpp, 2026-10-05

Обновлено: 2026-10-05
