Het ggml‑org-team heeft op 2026-10-09 llama.cpp versie b11527 uitgebracht. De update schakelt voor alle WebGPU-bewerkingen over op 2D-dispatch van werkgroepen en maakt een einde aan de oudere 1D-methode. Ook bevat de update nieuwe, vooraf gecompileerde binaries voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-configuraties, waaronder builds met Vulkan en CUDA. De wijzigingen zijn bedoeld om GPU-prestaties in browsers te verbeteren en de installatie op ondersteunde apparaten eenvoudiger te maken.
Waarom het ertoe doet
Ontwikkelaars kunnen LLM’s sneller draaien in browsers met WebGPU, zonder aangepaste kernelcode.