El equipo de ggml‑org publicó la versión b11527 de llama.cpp el 2026-10-09. La actualización cambia todas las operaciones de WebGPU al despacho de grupos de trabajo 2D y elimina el método anterior de 1D. También incluye nuevos binarios precompilados para macOS (Apple Silicon e Intel), iOS y varias configuraciones de Ubuntu, incluidas compilaciones para Vulkan y CUDA. Los cambios buscan ofrecer un rendimiento de GPU más fluido en los navegadores y facilitar la configuración en los dispositivos compatibles.
Por qué importa
Los desarrolladores pueden ejecutar LLM más rápido en navegadores compatibles con WebGPU sin tener que escribir código de kernel personalizado.