O projeto llama.cpp lançou a versão b11474 em 2026‑10‑07. Ela adiciona ao executor de modelos um grafo de predição de múltiplos tokens (MTP) do GLM5‑Next, chamado NextN. Com a mudança, o código evita cálculos desnecessários quando não há linhas de saída a gerar, reduzindo de 6,9 ms para 0,33 ms a latência de recuperação de 4 tokens. A atualização também corrige os contratos de extração e aprimora o tratamento de reversões recorrentes parciais.
Por que importa
Desenvolvedores podem executar modelos no llama.cpp com mais rapidez, especialmente ao usar geração baseada em rascunhos, que depende de predição de múltiplos tokens.