Le projet ggml‑org/llama.cpp a publié la version b11516 le 2026‑10‑09. Cette mise à jour corrige un bug dans la prise en charge des NPU Hexagon : l’anneau DMA pouvait déborder, entraînant des données obsolètes et des résultats NaN/inf. Le code supprime désormais le descripteur le plus ancien lorsque l’anneau est plein, puis vide la file d’attente ultérieurement. Les tests portant sur de grandes opérations patch‑embed passent désormais sur le matériel Hexagon.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp sur des appareils Qualcomm Hexagon obtiendront des résultats de modèle corrects au lieu de NaN erronés.