Le projet llama.cpp a publié la version b11474 le 2026‑10‑07. Elle ajoute au moteur d’exécution des modèles un graphe de prédiction multi-token (MTP) GLM5‑Next, baptisé NextN. Cette modification permet au code d’éviter des calculs inutiles lorsqu’aucune ligne de sortie n’est nécessaire, faisant passer la latence de rattrapage de 4 tokens de 6.9 ms à 0.33 ms. La mise à jour corrige également les contrats d’extraction et améliore la gestion des retours en arrière partiels dans les modèles récurrents.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter plus rapidement des modèles avec llama.cpp, en particulier lors de la génération assistée par brouillon, qui repose sur la prédiction multi-token.