ggml-org-teamet släppte llama.cpp version b11527 den 2026-10-09. Uppdateringen övergår till 2D-dispatch av arbetsgrupper för alla WebGPU-operationer och tar bort den äldre 1D-metoden. Den innehåller också nya förkompilerade versioner för macOS (Apple Silicon och Intel), iOS och flera Ubuntu-konfigurationer, däribland byggen med Vulkan och CUDA. Ändringarna ska ge jämnare GPU-prestanda i webbläsare och göra det enklare att komma igång på enheter som stöds.
Varför det spelar roll
Utvecklare kan köra LLM:er snabbare i webbläsare med WebGPU-stöd utan att behöva skriva egen kärnkod.