O projeto ggml‑org/llama.cpp lançou a versão b11516 em 2026‑10‑09. A atualização corrige um bug no caminho do NPU Hexagon, em que o buffer circular de DMA podia transbordar, causando dados desatualizados e resultados NaN/inf. Agora, quando o buffer fica cheio, o código descarta o descritor mais antigo e esvazia a fila posteriormente. Os testes com operações grandes de patch‑embed agora passam no hardware Hexagon.
Por que importa
Desenvolvedores que usam llama.cpp em dispositivos Qualcomm Hexagon terão resultados corretos do modelo, em vez de NaNs errados.