El proyecto llama.cpp publicó una nueva versión el 30 de septiembre de 2026. Esta incorpora compatibilidad con GLM‑5.3‑Flash (también llamado GLM5‑Next), una arquitectura de modelo de lenguaje más reciente. La actualización también reduce el tamaño del búfer de cálculo, acelera la decodificación con contextos largos y corrige varios errores relacionados con la gestión de tokens y la memoria de la GPU. Los cambios están pensados para desarrolladores que ejecutan LLM de forma local en CPU o GPU.
Por qué importa
Las nuevas funciones permiten ejecutar los modelos GLM más recientes con mayor rapidez y menos memoria en el hardware propio.