# llama.cpp incorpora MTP en GLM5‑Next y mejora la velocidad

> El motor de ejecución de LLM de código abierto ahora admite una nueva cabeza MTP de GLM5‑Next y reduce a 0.33 ms la latencia de puesta al día de 4 tokens.

Oossa · 2026-10-07 · https://oossa.com/es/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

El proyecto llama.cpp publicó la versión b11474 el 2026‑10‑07. Añade al motor de ejecución de modelos un grafo de predicción de múltiples tokens (MTP) para GLM5‑Next, llamado NextN. Este cambio permite al código omitir cálculos innecesarios cuando no se necesitan filas de salida y reduce de 6.9 ms a 0.33 ms la latencia de puesta al día de 4 tokens. La actualización también corrige los contratos de extracción y mejora el manejo de las reversiones recurrentes parciales.

## Los hechos

- La versión b11474 se publicó el 2026‑10‑07 ("Wed Oct 07 2026 15:42:20 GMT+0200")
- La latencia de puesta al día de 4 tokens bajó de 6.9 ms a 0.33 ms

## Por qué importa

Los desarrolladores ahora pueden ejecutar modelos en llama.cpp más rápido, sobre todo al usar generación basada en borradores que depende de la predicción de múltiples tokens.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Última actualización: 2026-10-07
