Het project ggml-org/llama.cpp heeft op 2026-10-09 versie b11516 uitgebracht. De update verhelpt een fout in het Hexagon NPU-pad waarbij de DMA-ring kon overlopen, met verouderde gegevens en NaN/inf-resultaten tot gevolg. De code verwijdert nu de oudste descriptor als de ring vol is en leegt de wachtrij later. Testgevallen met grote patch-embed-bewerkingen slagen nu op Hexagon-hardware.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp op Qualcomm Hexagon-apparaten gebruiken, krijgen voortaan correcte modeluitvoer in plaats van foutieve NaN’s.