پروژهٔ llama.cpp نسخهٔ تازهای را در ۳۰ سپتامبر ۲۰۲۶ منتشر کرد. این نسخه از GLM‑5.3‑Flash (که GLM5‑Next هم نامیده میشود)، معماری جدیدتر مدلهای زبانی، پشتیبانی میکند. بهروزرسانی همچنین اندازهٔ بافر محاسباتی را کاهش میدهد، رمزگشایی متنهای طولانی را سرعت میبخشد و چندین باگ مربوط به مدیریت توکنها و حافظهٔ GPU را رفع میکند. این تغییرات برای توسعهدهندگانی طراحی شدهاند که مدلهای زبانی بزرگ را بهصورت محلی روی CPU یا GPU اجرا میکنند.
چرا مهم است
قابلیتهای تازه به کاربران امکان میدهد جدیدترین مدلهای GLM را سریعتر و با حافظهٔ کمتر روی سختافزار خود اجرا کنند.