Le projet llama.cpp a publié une nouvelle version le 30 septembre 2026. Celle-ci prend en charge GLM‑5.3‑Flash (également appelé GLM5‑Next), une architecture de modèle de langage plus récente. La mise à jour réduit aussi la taille du tampon de calcul, accélère le décodage des longs contextes et corrige plusieurs bugs liés à la gestion des jetons et à la mémoire GPU. Ces changements s’adressent aux développeurs qui exécutent des LLM en local sur CPU ou GPU.
Pourquoi c'est important
Ces nouveautés permettent d’exécuter les modèles GLM les plus récents plus rapidement et avec moins de mémoire sur son propre matériel.