A equipe ggml-org publicou a versão b11540 do llama.cpp em 10 de outubro de 2026. A atualização adiciona suporte a SYCL para acelerar modelos de mistura de especialistas (MoE) MXFP4, usando decodificação aritmética e reordenação de pesos. Também inclui binários pré-compilados para Apple Silicon e Intel no macOS, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA). As mudanças estão listadas no GitHub sob a tag b11540.
Por que importa
Desenvolvedores agora podem executar modelos MoE maiores com mais rapidez em GPUs compatíveis com SYCL, ampliando as opções de hardware para quem usa o llama.cpp.