Teamet ggml-org publicerade llama.cpp version b11499 den 8 okt. 2026. I uppdateringen ändras CUDA-backenden så att roll-operationen använder bytebaserade steg, vilket gör att grafikprocessorn kan hantera icke sammanhängande data korrekt. Versionen innehåller också nya binärer för Apple Silicon, Intel-baserade Mac-datorer, iOS och flera Ubuntu-varianter (CPU, Vulkan och CUDA 12). Alla filer finns att hämta på GitHub-sidan för versionen.
Varför det spelar roll
Utvecklare kan köra llama.cpp på fler GPU-konfigurationer utan fel, vilket breddar möjligheterna att använda lokala LLM:er på stationära datorer och servrar.