# llama.cpp ganha suporte a MTP do GLM5‑Next e fica mais rápido

> O executor de LLMs de código aberto agora é compatível com um novo cabeçalho MTP do GLM5‑Next e reduz para 0,33 ms o tempo de recuperação de 4 tokens.

Oossa · 2026-10-07 · https://oossa.com/pt/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

O projeto llama.cpp lançou a versão b11474 em 2026‑10‑07. Ela adiciona ao executor de modelos um grafo de predição de múltiplos tokens (MTP) do GLM5‑Next, chamado NextN. Com a mudança, o código evita cálculos desnecessários quando não há linhas de saída a gerar, reduzindo de 6,9 ms para 0,33 ms a latência de recuperação de 4 tokens. A atualização também corrige os contratos de extração e aprimora o tratamento de reversões recorrentes parciais.

## Os fatos

- Versão b11474 lançada em 2026‑10‑07 ("Wed Oct 07 2026 15:42:20 GMT+0200")
- Latência de recuperação de 4 tokens reduzida de 6,9 ms para 0,33 ms

## Por que importa

Desenvolvedores podem executar modelos no llama.cpp com mais rapidez, especialmente ao usar geração baseada em rascunhos, que depende de predição de múltiplos tokens.

## Fontes e referências

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Última atualização: 2026-10-07
