Oossa

llama.cpp passa a oferecer cache MoE em várias GPUs

A biblioteca de código aberto llama.cpp agora permite executar modelos de mistura de especialistas em várias GPUs.

NotaPor Publicado pelo Oossa: 1 min de leitura

A equipe ggml-org lançou a versão b11507 do llama.cpp em 8 de outubro de 2026. A atualização adiciona suporte a um cache de mistura de especialistas (MoE) que pode ser distribuído entre várias GPUs. Com isso, desenvolvedores podem executar modelos MoE maiores sem precisar acomodar tudo em uma única placa. A versão também inclui novos pacotes binários para macOS, iOS e várias configurações do Linux, incluindo suporte ao CUDA 12.8.

Por que importa

Agora, desenvolvedores podem executar modelos de IA maiores e mais capazes em sistemas com várias GPUs, ampliando o que é possível fazer em hardware pessoal.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.