# llama.cpp ganha suporte ao GLM‑5.3‑Flash e melhorias de desempenho

> O ambiente de execução de LLMs de código aberto llama.cpp v0.1.0 passa a oferecer suporte ao modelo GLM‑5.3‑Flash e inclui melhorias de velocidade e uso de memória.

Oossa · 2026-09-30 · https://oossa.com/pt/llama-cpp-updates-add-glm-5-3-flash-support-and-performance-tweaks

Produzido e traduzido com auxílio de IA. Consulte as fontes originais abaixo.

O projeto llama.cpp lançou uma nova versão em 30 de setembro de 2026. Ela adiciona suporte ao GLM‑5.3‑Flash (também chamado GLM5‑Next), uma arquitetura mais recente de modelo de linguagem. A atualização também reduz o tamanho do buffer de computação, acelera a decodificação de contextos longos e corrige vários bugs relacionados ao processamento de tokens e à memória da GPU. As mudanças são voltadas a desenvolvedores que executam LLMs localmente em CPUs ou GPUs.

## Os fatos

- Data de lançamento: 2026‑09‑30 ("qua., 30 de set. de 2026")
- Adiciona suporte ao modelo GLM‑5.3‑Flash (GLM5‑Next)

## Por que importa

Os novos recursos permitem que usuários executem os modelos GLM mais recentes com mais velocidade e menos memória no próprio hardware.

## Fontes e referências

1. [ggml-org/llama.cpp b11279](https://github.com/ggml-org/llama.cpp/releases/tag/b11279) – llama.cpp, 2026-09-30
2. [add GLM-5.3-Flash (GLM5-Next) support by timkhronos · Pull Request #27773 · ggml-org/llama.cpp](https://www.reddit.com/r/LocalLLaMA/comments/1wu0bdf/add_glm53flash_glm5next_support_by_timkhronos/) – Reddit r/LocalLLaMA, 2026-09-30
3. [add GLM-5.3-Flash (GLM5-Next) support (#27773) · ggml-org/llama.cpp@649dcb1](https://www.reddit.com/r/LocalLLaMA/comments/1wu3wxu/add_glm53flash_glm5next_support_27773/) – Reddit r/LocalLLaMA, 2026-09-30

Última atualização: 2026-09-30
