O projeto llama.cpp lançou a versão b11430 em 2026‑10‑05. Ela adiciona a flag GGML_HEXAGON_FA_HEAD_SPLIT, que permite que cada núcleo processe apenas um subconjunto das cabeças de atenção quando o número de cabeças KV é divisível pelo número de núcleos. Isso reduz a quantidade de cache KV que cada núcleo precisa ler e melhora o uso da largura de banda da memória. Em testes com quatro núcleos, o Qwen3‑0.6B teve um ganho de velocidade de 58%, e o llama‑3.2‑3B, de 49%. A mudança é opcional e pode ser ativada pela nova opção –fa-head-split no run.py.
Por que importa
Desenvolvedores que usam llama.cpp em hardware Qualcomm Hexagon podem obter inferência consideravelmente mais rápida em modelos compatíveis, sem alterar o código.