Het ggml-org-team bracht llama.cpp-release b11499 uit op 8 okt 2026. De update past de CUDA-backend aan zodat die voor de roll-bewerking byte-strides gebruikt. Daardoor kan de GPU niet-aaneengesloten data correct verwerken. De release bevat ook nieuwe binaries voor Apple Silicon, Intel-Macs, iOS en verschillende Ubuntu-builds (CPU, Vulkan en CUDA 12). Alle bestanden zijn te downloaden via de GitHub-releasepagina.
Waarom het ertoe doet
Ontwikkelaars kunnen llama.cpp op meer GPU-configuraties gebruiken zonder fouten, waardoor lokale LLM's op desktops en servers breder inzetbaar worden.