Проект llama.cpp выпустил версию b11430 2026‑10‑05. В ней появился флаг GGML_HEXAGON_FA_HEAD_SPLIT: он позволяет каждому ядру обрабатывать только часть голов внимания, если число KV-голов делится на число ядер без остатка. Благодаря этому каждому ядру нужно считывать меньше данных из KV-кэша, что повышает эффективность использования пропускной способности памяти. В тестах на четырёх ядрах Qwen3‑0.6B показала прирост скорости на 58%, а llama‑3.2‑3B — на 49%. Функция необязательная и включается новым параметром –fa-head-split в run.py.
Почему это важно
Разработчики, использующие llama.cpp на оборудовании Qualcomm Hexagon, могут заметно ускорить работу поддерживаемых моделей, не меняя код.