Oossa

llama.cpp acelera atenção flash no Hexagon com nova opção

A nova flag GGML_HEXAGON_FA_HEAD_SPLIT acelera em até 58% a atenção flash em vários núcleos, nos modelos compatíveis.

NotaOossaPublicado pelo Oossa: 1 min de leitura

O projeto llama.cpp lançou a versão b11430 em 2026‑10‑05. Ela adiciona a flag GGML_HEXAGON_FA_HEAD_SPLIT, que permite que cada núcleo processe apenas um subconjunto das cabeças de atenção quando o número de cabeças KV é divisível pelo número de núcleos. Isso reduz a quantidade de cache KV que cada núcleo precisa ler e melhora o uso da largura de banda da memória. Em testes com quatro núcleos, o Qwen3‑0.6B teve um ganho de velocidade de 58%, e o llama‑3.2‑3B, de 49%. A mudança é opcional e pode ser ativada pela nova opção –fa-head-split no run.py.

Por que importa

Desenvolvedores que usam llama.cpp em hardware Qualcomm Hexagon podem obter inferência consideravelmente mais rápida em modelos compatíveis, sem alterar o código.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.