Das Team von ggml-org hat am 2026-10-09 llama.cpp Version b11527 veröffentlicht. Das Update stellt alle WebGPU-Operationen auf einen 2D-Workgroup-Dispatch um und ersetzt damit das bisherige 1D-Verfahren. Außerdem enthält es neue vorkompilierte Binärdateien für macOS (Apple Silicon und Intel), iOS und verschiedene Ubuntu-Konfigurationen, darunter Builds mit Vulkan und CUDA. Die Änderungen sollen für eine flüssigere GPU-Leistung in Browsern sorgen und die Einrichtung auf unterstützten Geräten vereinfachen.
Warum es wichtig ist
Entwickler können LLMs in WebGPU-fähigen Browsern schneller ausführen, ohne eigenen Kernel-Code schreiben zu müssen.