O projeto llama.cpp lançou uma nova versão em 30 de setembro de 2026. Ela adiciona suporte ao GLM‑5.3‑Flash (também chamado GLM5‑Next), uma arquitetura mais recente de modelo de linguagem. A atualização também reduz o tamanho do buffer de computação, acelera a decodificação de contextos longos e corrige vários bugs relacionados ao processamento de tokens e à memória da GPU. As mudanças são voltadas a desenvolvedores que executam LLMs localmente em CPUs ou GPUs.
Por que importa
Os novos recursos permitem que usuários executem os modelos GLM mais recentes com mais velocidade e menos memória no próprio hardware.