# llama.cpp aggiunge MTP per GLM5‑Next e migliora le prestazioni

> Il runner open source per LLM supporta ora una nuova testa MTP per GLM5‑Next: il recupero di 4 token scende a 0.33 ms.

Oossa · 2026-10-07 · https://oossa.com/it/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

Il progetto llama.cpp ha rilasciato la versione b11474 il 2026‑10‑07. La novità è un grafo di previsione multi-token (MTP) per GLM5‑Next, chiamato NextN, integrato nel runner. Questa modifica consente al codice di saltare calcoli non necessari quando non servono righe di output, riducendo la latenza di recupero di 4 token da 6.9 ms a 0.33 ms. L’aggiornamento corregge anche i contratti di estrazione e migliora la gestione dei rollback ricorrenti parziali.

## I fatti

- Versione b11474 rilasciata il 2026‑10‑07 ("Wed Oct 07 2026 15:42:20 GMT+0200")
- Latenza di recupero di 4 token ridotta da 6.9 ms a 0.33 ms

## Perché conta

Gli sviluppatori possono eseguire più velocemente i modelli con llama.cpp, soprattutto usando la generazione basata su draft che sfrutta la previsione multi-token.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Ultimo aggiornamento: 2026-10-07
