Projektet ggml-org/llama.cpp släppte version b11530 den 2026-10-09. Ändringen gör backendens samplinggraf statisk mellan ubatcher, så att grafens form inte längre ändras under reserverings- och avkodningssteg. Det löser krascher som uppstod när grafens topologi ändrades efter en reserveringskörning. Korrigeringen gäller alla listade versioner – macOS, Linux, Android, Windows och openEuler – och alla maskinvarubackdelar, till exempel CUDA, Vulkan och OpenCL.
Varför det spelar roll
Utvecklare som använder llama.cpp får färre körningsfel vid generering med flera utdata på alla processorer och grafikprocessorer som stöds.