# llama.cpp adiciona cache de GPU para especialistas MoE

> A biblioteca de código aberto llama.cpp agora armazena dados de mixture-of-experts (MoE) em um cache de GPU mantido na memória do host.

Oossa · 2026-10-08 · https://oossa.com/pt/llama-cpp-adds-gpu-cache-for-moe-experts

A equipe ggml‑org lançou a versão b11480 do llama.cpp em 2026‑10‑08. A atualização adiciona um cache de GPU para especialistas MoE, mantido na memória do host, que ajuda modelos grandes a rodar mais rápido em GPUs. A alteração está identificada como assistida por Claude e usa uma nova API, llama_moe_cache_ptr. Há binários pré-compilados para macOS, iOS e várias configurações do Ubuntu disponíveis para download.

## Os fatos

- Versão do lançamento: b11480
- Data do lançamento: 2026‑10‑08

## Por que importa

Desenvolvedores agora podem executar modelos MoE com mais eficiência em GPUs de consumo, reduzindo o custo de hardware para projetos de IA.

## Fontes e referências

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Última atualização: 2026-10-08
