Il progetto llama.cpp ha rilasciato una nuova versione il 30 settembre 2026. L’aggiornamento introduce il supporto a GLM‑5.3‑Flash (chiamato anche GLM5‑Next), una nuova architettura di modello linguistico. Riduce inoltre le dimensioni del buffer di calcolo, velocizza la decodifica dei testi con contesto lungo e corregge diversi bug nella gestione dei token e della memoria GPU. Le modifiche sono pensate per gli sviluppatori che eseguono LLM in locale su CPU o GPU.
Perché conta
Le nuove funzionalità permettono di eseguire gli ultimi modelli GLM più velocemente e con meno memoria sul proprio hardware.