Oossa

llama.cpp ajoute la prédiction multi-token GLM5‑Next et accélère son exécution

Le moteur open source pour LLM prend désormais en charge une nouvelle tête MTP GLM5‑Next, qui ramène le rattrapage de 4 tokens à 0.33 ms.

BrèvePar Publié par Oossa: 1 min de lecture

Le projet llama.cpp a publié la version b11474 le 2026‑10‑07. Elle ajoute au moteur d’exécution des modèles un graphe de prédiction multi-token (MTP) GLM5‑Next, baptisé NextN. Cette modification permet au code d’éviter des calculs inutiles lorsqu’aucune ligne de sortie n’est nécessaire, faisant passer la latence de rattrapage de 4 tokens de 6.9 ms à 0.33 ms. La mise à jour corrige également les contrats d’extraction et améliore la gestion des retours en arrière partiels dans les modèles récurrents.

Pourquoi c'est important

Les développeurs peuvent désormais exécuter plus rapidement des modèles avec llama.cpp, en particulier lors de la génération assistée par brouillon, qui repose sur la prédiction multi-token.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.