# llama.cpp passa a oferecer cache MoE em várias GPUs

> A biblioteca de código aberto llama.cpp agora permite executar modelos de mistura de especialistas em várias GPUs.

Oossa · 2026-10-08 · https://oossa.com/pt/llama-cpp-adds-multi-gpu-moe-cache-support

A equipe ggml-org lançou a versão b11507 do llama.cpp em 8 de outubro de 2026. A atualização adiciona suporte a um cache de mistura de especialistas (MoE) que pode ser distribuído entre várias GPUs. Com isso, desenvolvedores podem executar modelos MoE maiores sem precisar acomodar tudo em uma única placa. A versão também inclui novos pacotes binários para macOS, iOS e várias configurações do Linux, incluindo suporte ao CUDA 12.8.

## Os fatos

- Versão b11507 lançada em 2026-10-08
- Adiciona cache MoE distribuído entre várias GPUs

## Por que importa

Agora, desenvolvedores podem executar modelos de IA maiores e mais capazes em sistemas com várias GPUs, ampliando o que é possível fazer em hardware pessoal.

## Fontes e referências

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Última atualização: 2026-10-08
