Oossa

llama.cpp aggiunge MTP per GLM5‑Next e migliora le prestazioni

Il runner open source per LLM supporta ora una nuova testa MTP per GLM5‑Next: il recupero di 4 token scende a 0.33 ms.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il progetto llama.cpp ha rilasciato la versione b11474 il 2026‑10‑07. La novità è un grafo di previsione multi-token (MTP) per GLM5‑Next, chiamato NextN, integrato nel runner. Questa modifica consente al codice di saltare calcoli non necessari quando non servono righe di output, riducendo la latenza di recupero di 4 token da 6.9 ms a 0.33 ms. L’aggiornamento corregge anche i contratti di estrazione e migliora la gestione dei rollback ricorrenti parziali.

Perché conta

Gli sviluppatori possono eseguire più velocemente i modelli con llama.cpp, soprattutto usando la generazione basata su draft che sfrutta la previsione multi-token.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.