Il progetto ggml‑org/llama.cpp ha pubblicato la versione b11530 il 2026-10-09. La modifica mantiene statico il grafo di sampling del backend tra un’ubatch e l’altra, così la sua struttura non cambia più durante le fasi di reserve e decode. Questo risolve gli arresti anomali che si verificavano quando la topologia del grafo cambiava dopo una fase di reserve build. La correzione si applica a tutte le build indicate – macOS, Linux, Android, Windows e openEuler – e a tutti i backend hardware, come CUDA, Vulkan e OpenCL.
Perché conta
Chi sviluppa con llama.cpp riscontrerà meno errori di esecuzione nelle generazioni con più output, su qualsiasi CPU o GPU supportata.