Il progetto llama.cpp ha rilasciato la versione b11474 il 2026‑10‑07. La novità è un grafo di previsione multi-token (MTP) per GLM5‑Next, chiamato NextN, integrato nel runner. Questa modifica consente al codice di saltare calcoli non necessari quando non servono righe di output, riducendo la latenza di recupero di 4 token da 6.9 ms a 0.33 ms. L’aggiornamento corregge anche i contratti di estrazione e migliora la gestione dei rollback ricorrenti parziali.
Perché conta
Gli sviluppatori possono eseguire più velocemente i modelli con llama.cpp, soprattutto usando la generazione basata su draft che sfrutta la previsione multi-token.