A equipe ggml-org lançou a versão b11493 do llama.cpp em 8 de outubro de 2026. A atualização adiciona uma implementação em SYCL de GEMM XMX agrupado para Mixture-of-Experts (MoE), uma multiplicação de matrizes usada em grandes modelos de linguagem. O lançamento também inclui binários pré-compilados para macOS, iOS e Ubuntu (CPU, Vulkan e CUDA).
Por que importa
Agora, desenvolvedores podem executar modelos baseados em MoE em GPUs compatíveis com SYCL, ampliando as opções de hardware para cargas de trabalho de LLMs de código aberto.