Projektet llama.cpp släppte en ny version den 30 september 2026. Den lägger till stöd för GLM‑5.3‑Flash (även kallad GLM5‑Next), en nyare språkmodellarkitektur. Uppdateringen minskar också storleken på beräkningsbufferten, snabbar upp avkodning med långa kontexter och åtgärdar flera buggar kopplade till tokenhantering och GPU-minne. Ändringarna riktar sig till utvecklare som kör stora språkmodeller lokalt på CPU eller GPU.
Varför det spelar roll
De nya funktionerna gör att användare kan köra de senaste GLM-modellerna snabbare och med mindre minne på sin egen maskinvara.