Проект ggml‑org/llama.cpp выпустил версию b11516 2026‑10‑09. В обновлении исправлена ошибка в коде для NPU Hexagon: кольцевой буфер DMA мог переполняться, из-за чего использовались устаревшие данные, а результаты содержали NaN/inf. Теперь, если буфер заполнен, код удаляет самый старый дескриптор, а позднее очищает очередь. Тесты с большими операциями patch-embed теперь проходят на оборудовании Hexagon.
Почему это важно
Разработчики, использующие llama.cpp на устройствах с Qualcomm Hexagon, будут получать корректные результаты работы моделей без ошибочных значений NaN.