El proyecto llama.cpp publicó la versión b11474 el 2026‑10‑07. Añade al motor de ejecución de modelos un grafo de predicción de múltiples tokens (MTP) para GLM5‑Next, llamado NextN. Este cambio permite al código omitir cálculos innecesarios cuando no se necesitan filas de salida y reduce de 6.9 ms a 0.33 ms la latencia de puesta al día de 4 tokens. La actualización también corrige los contratos de extracción y mejora el manejo de las reversiones recurrentes parciales.
Por qué importa
Los desarrolladores ahora pueden ejecutar modelos en llama.cpp más rápido, sobre todo al usar generación basada en borradores que depende de la predicción de múltiples tokens.