El equipo de ggml-org publicó la versión b11493 de llama.cpp el 8 de octubre de 2026. La actualización incorpora una implementación en SYCL de grouped Mixture-of-Experts (MoE) XMX GEMM, una multiplicación de matrices que se usa en los modelos de lenguaje grandes. El lanzamiento también incluye binarios precompilados para macOS, iOS y Ubuntu (CPU, Vulkan y CUDA).
Por qué importa
Los desarrolladores ya pueden ejecutar modelos basados en MoE en GPU compatibles con SYCL, lo que amplía las opciones de hardware para las cargas de trabajo de LLM de código abierto.