A equipe ggml-org lançou a versão b11507 do llama.cpp em 8 de outubro de 2026. A atualização adiciona suporte a um cache de mistura de especialistas (MoE) que pode ser distribuído entre várias GPUs. Com isso, desenvolvedores podem executar modelos MoE maiores sem precisar acomodar tudo em uma única placa. A versão também inclui novos pacotes binários para macOS, iOS e várias configurações do Linux, incluindo suporte ao CUDA 12.8.
Por que importa
Agora, desenvolvedores podem executar modelos de IA maiores e mais capazes em sistemas com várias GPUs, ampliando o que é possível fazer em hardware pessoal.