Oossa

llama.cpp adiciona cache de GPU para especialistas MoE

A biblioteca de código aberto llama.cpp agora armazena dados de mixture-of-experts (MoE) em um cache de GPU mantido na memória do host.

NotaPor Publicado pelo Oossa: Última atualização: 1 min de leitura

A equipe ggml‑org lançou a versão b11480 do llama.cpp em 2026‑10‑08. A atualização adiciona um cache de GPU para especialistas MoE, mantido na memória do host, que ajuda modelos grandes a rodar mais rápido em GPUs. A alteração está identificada como assistida por Claude e usa uma nova API, llama_moe_cache_ptr. Há binários pré-compilados para macOS, iOS e várias configurações do Ubuntu disponíveis para download.

Por que importa

Desenvolvedores agora podem executar modelos MoE com mais eficiência em GPUs de consumo, reduzindo o custo de hardware para projetos de IA.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.