El equipo de ggml-org publicó llama.cpp versión b11540 el 10 de octubre de 2026. La actualización añade compatibilidad con SYCL para acelerar los modelos de mezcla de expertos (MoE) MXFP4 mediante decodificación aritmética y reordenamiento de pesos. También incluye binarios precompilados para Apple Silicon y equipos Intel con macOS, iOS y varias versiones de Ubuntu (CPU, Vulkan y CUDA). Los cambios están publicados en GitHub bajo la etiqueta b11540.
Por qué importa
Los desarrolladores ahora pueden ejecutar modelos MoE más grandes y rápido en GPU compatibles con SYCL, lo que amplía las opciones de hardware para quienes usan llama.cpp.