# llama.cpp aggiunge GLM‑5.3‑Flash e migliora le prestazioni

> La versione v0.1.0 del runtime LLM open source llama.cpp introduce il supporto a GLM‑5.3‑Flash e diverse ottimizzazioni per velocità e memoria.

Oossa · 2026-09-30 · https://oossa.com/it/llama-cpp-updates-add-glm-5-3-flash-support-and-performance-tweaks

Prodotto e tradotto con l’aiuto dell’IA. Consulta le fonti originali qui sotto.

Il progetto llama.cpp ha rilasciato una nuova versione il 30 settembre 2026. L’aggiornamento introduce il supporto a GLM‑5.3‑Flash (chiamato anche GLM5‑Next), una nuova architettura di modello linguistico. Riduce inoltre le dimensioni del buffer di calcolo, velocizza la decodifica dei testi con contesto lungo e corregge diversi bug nella gestione dei token e della memoria GPU. Le modifiche sono pensate per gli sviluppatori che eseguono LLM in locale su CPU o GPU.

## I fatti

- Data di rilascio: 2026‑09‑30 («mercoledì 30 settembre 2026»)
- Aggiunge il supporto al modello GLM‑5.3‑Flash (GLM5‑Next)

## Perché conta

Le nuove funzionalità permettono di eseguire gli ultimi modelli GLM più velocemente e con meno memoria sul proprio hardware.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11279](https://github.com/ggml-org/llama.cpp/releases/tag/b11279) – llama.cpp, 2026-09-30
2. [add GLM-5.3-Flash (GLM5-Next) support by timkhronos · Pull Request #27773 · ggml-org/llama.cpp](https://www.reddit.com/r/LocalLLaMA/comments/1wu0bdf/add_glm53flash_glm5next_support_by_timkhronos/) – Reddit r/LocalLLaMA, 2026-09-30
3. [add GLM-5.3-Flash (GLM5-Next) support (#27773) · ggml-org/llama.cpp@649dcb1](https://www.reddit.com/r/LocalLLaMA/comments/1wu3wxu/add_glm53flash_glm5next_support_27773/) – Reddit r/LocalLLaMA, 2026-09-30

Ultimo aggiornamento: 2026-09-30
