A equipe ggml‑org lançou a versão b11480 do llama.cpp em 2026‑10‑08. A atualização adiciona um cache de GPU para especialistas MoE, mantido na memória do host, que ajuda modelos grandes a rodar mais rápido em GPUs. A alteração está identificada como assistida por Claude e usa uma nova API, llama_moe_cache_ptr. Há binários pré-compilados para macOS, iOS e várias configurações do Ubuntu disponíveis para download.
Por que importa
Desenvolvedores agora podem executar modelos MoE com mais eficiência em GPUs de consumo, reduzindo o custo de hardware para projetos de IA.