Oossa

llama.cpp acelera la atención flash en Hexagon con una opción de división

La nueva opción GGML_HEXAGON_FA_HEAD_SPLIT acelera hasta un 58% la atención flash multinúcleo en los modelos compatibles.

BreveOossaPublicado por Oossa: 1 min de lectura

El proyecto llama.cpp publicó la versión b11430 el 2026‑10‑05. Esta incorpora una opción llamada GGML_HEXAGON_FA_HEAD_SPLIT que permite que cada núcleo procese solo un subconjunto de las cabezas de atención cuando el número de cabezas KV se puede dividir uniformemente entre los núcleos. Así, cada núcleo tiene que leer menos caché KV y aprovecha mejor el ancho de banda de memoria. En pruebas con cuatro núcleos, Qwen3‑0.6B logró un aumento de velocidad del 58% y llama‑3.2‑3B, del 49%. El cambio es opcional y se controla con la nueva opción –fa-head-split de run.py.

Por qué importa

Los desarrolladores que ejecutan llama.cpp en hardware Qualcomm Hexagon pueden acelerar notablemente la inferencia en los modelos compatibles sin modificar su código.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.