OossaA IA evolui rápido. Nós explicamos de forma simples.

Atualização do llama.cpp melhora multiplicação de matrizes em MoE

A versão de 30 de setembro de 2026 ajusta a seleção de blocos no Vulkan e reduz o trabalho desperdiçado em modelos Mixture-of-Experts.

NotaOossa1 min de leitura

A biblioteca de código aberto llama.cpp recebeu uma correção para a multiplicação de matrizes com suporte a MoE no Vulkan. A mudança ajusta a forma como o código escolhe os tamanhos dos blocos para a operação mat_mul_id, fazendo com que correspondam ao número real de linhas ativas por especialista. Em um teste com um modelo de 30 bilhões de parâmetros, a correção reduziu o trabalho ocioso da GPU, que antes consumia 55% do tempo de execução.

Por que importa

Menos tempo ocioso da GPU significa inferência mais rápida para grandes modelos MoE executados em hardware compatível com Vulkan.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.

Fontes e referências

#FonteVeículoDataPonto principal
1ggml-org/llama.cpp b11265 ↗llama.cpp29 de set. de 2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 fontes

Última atualização: ·Markdown·llms.txt