Oossa

llama.cpp ganha suporte a MTP do GLM5‑Next e fica mais rápido

O executor de LLMs de código aberto agora é compatível com um novo cabeçalho MTP do GLM5‑Next e reduz para 0,33 ms o tempo de recuperação de 4 tokens.

NotaPor Publicado pelo Oossa: 1 min de leitura

O projeto llama.cpp lançou a versão b11474 em 2026‑10‑07. Ela adiciona ao executor de modelos um grafo de predição de múltiplos tokens (MTP) do GLM5‑Next, chamado NextN. Com a mudança, o código evita cálculos desnecessários quando não há linhas de saída a gerar, reduzindo de 6,9 ms para 0,33 ms a latência de recuperação de 4 tokens. A atualização também corrige os contratos de extração e aprimora o tratamento de reversões recorrentes parciais.

Por que importa

Desenvolvedores podem executar modelos no llama.cpp com mais rapidez, especialmente ao usar geração baseada em rascunhos, que depende de predição de múltiplos tokens.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.