# llama.cpp ajoute la prédiction multi-token GLM5‑Next et accélère son exécution

> Le moteur open source pour LLM prend désormais en charge une nouvelle tête MTP GLM5‑Next, qui ramène le rattrapage de 4 tokens à 0.33 ms.

Oossa · 2026-10-07 · https://oossa.com/fr/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

Le projet llama.cpp a publié la version b11474 le 2026‑10‑07. Elle ajoute au moteur d’exécution des modèles un graphe de prédiction multi-token (MTP) GLM5‑Next, baptisé NextN. Cette modification permet au code d’éviter des calculs inutiles lorsqu’aucune ligne de sortie n’est nécessaire, faisant passer la latence de rattrapage de 4 tokens de 6.9 ms à 0.33 ms. La mise à jour corrige également les contrats d’extraction et améliore la gestion des retours en arrière partiels dans les modèles récurrents.

## Les faits

- Version b11474 publiée le 2026‑10‑07 (« Wed Oct 07 2026 15:42:20 GMT+0200 »)
- Latence de rattrapage de 4 tokens réduite de 6.9 ms à 0.33 ms

## Pourquoi c'est important

Les développeurs peuvent désormais exécuter plus rapidement des modèles avec llama.cpp, en particulier lors de la génération assistée par brouillon, qui repose sur la prédiction multi-token.

## Sources et références

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Dernière mise à jour: 2026-10-07
