Oossa

llama.cpp incorpora MTP en GLM5‑Next y mejora la velocidad

El motor de ejecución de LLM de código abierto ahora admite una nueva cabeza MTP de GLM5‑Next y reduce a 0.33 ms la latencia de puesta al día de 4 tokens.

BrevePor Publicado por Oossa: 1 min de lectura

El proyecto llama.cpp publicó la versión b11474 el 2026‑10‑07. Añade al motor de ejecución de modelos un grafo de predicción de múltiples tokens (MTP) para GLM5‑Next, llamado NextN. Este cambio permite al código omitir cálculos innecesarios cuando no se necesitan filas de salida y reduce de 6.9 ms a 0.33 ms la latencia de puesta al día de 4 tokens. La actualización también corrige los contratos de extracción y mejora el manejo de las reversiones recurrentes parciales.

Por qué importa

Los desarrolladores ahora pueden ejecutar modelos en llama.cpp más rápido, sobre todo al usar generación basada en borradores que depende de la predicción de múltiples tokens.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.