Het llama.cpp-project bracht op 30 september 2026 een nieuwe versie uit. Die ondersteunt GLM‑5.3‑Flash (ook bekend als GLM5‑Next), een nieuwere taalmodelarchitectuur. De update verkleint ook de buffer voor rekenwerk, versnelt het decoderen van lange contexten en verhelpt verschillende problemen met tokenverwerking en GPU-geheugen. De wijzigingen zijn bedoeld voor ontwikkelaars die LLM’s lokaal op CPU’s of GPU’s draaien.
Waarom het ertoe doet
Dankzij de nieuwe functies kunnen gebruikers de nieuwste GLM-modellen sneller en met minder geheugen op hun eigen hardware draaien.