# Atualização do llama.cpp melhora multiplicação de matrizes em MoE

> A versão de 30 de setembro de 2026 ajusta a seleção de blocos no Vulkan e reduz o trabalho desperdiçado em modelos Mixture-of-Experts.

Oossa · 2026-09-29 · https://oossa.com/pt/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

A biblioteca de código aberto llama.cpp recebeu uma correção para a multiplicação de matrizes com suporte a MoE no Vulkan. A mudança ajusta a forma como o código escolhe os tamanhos dos blocos para a operação mat_mul_id, fazendo com que correspondam ao número real de linhas ativas por especialista. Em um teste com um modelo de 30 bilhões de parâmetros, a correção reduziu o trabalho ocioso da GPU, que antes consumia 55% do tempo de execução.

## Os fatos

- A versão b11265 foi lançada em 30 de setembro de 2026
- No teste com o Sarvam 30B, o desperdício de desempenho caiu de 55% para quase zero

## Por que importa

Menos tempo ocioso da GPU significa inferência mais rápida para grandes modelos MoE executados em hardware compatível com Vulkan.

## Fontes e referências

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Última atualização: 2026-09-29
