Het project ggml‑org/llama.cpp heeft op 2026‑10‑09 versie b11530 uitgebracht. De wijziging houdt de samplinggraph van de backend statisch over ubatches heen, zodat de vorm van de graph niet langer verandert tijdens reserve- en decodeerstappen. Hiermee worden crashes verholpen die ontstonden wanneer de topologie van de graph na een reserve-build verschoof. De oplossing geldt voor alle vermelde builds – macOS, Linux, Android, Windows en openEuler – en voor alle hardwarebackends, zoals CUDA, Vulkan en OpenCL.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp gebruiken, krijgen minder runtimefouten bij het uitvoeren van generaties met meerdere outputs op elke ondersteunde CPU of GPU.