# llama.cpp 更新：支持 GLM‑5.3‑Flash 并优化性能

> 开源大语言模型运行时 llama.cpp v0.1.0 新增对 GLM‑5.3‑Flash 的支持，并修复多项速度和内存问题。

Oossa · 2026-09-30 · https://oossa.com/zh/llama-cpp-updates-add-glm-5-3-flash-support-and-performance-tweaks

借助 AI 编写和翻译。请核对下方原始来源。

llama.cpp 项目于 2026 年 9 月 30 日发布新版本。此次更新新增对 GLM‑5.3‑Flash（又称 GLM5‑Next）这一新型语言模型架构的支持，还缩小了计算缓冲区、加快了长上下文解码，并修复了若干与 token 处理和 GPU 内存相关的错误。这些改动主要面向在 CPU 或 GPU 上本地运行大语言模型的开发者。

## 事实

- 发布日期：2026‑09‑30（“2026 年 9 月 30 日，星期三”）
- 新增对 GLM‑5.3‑Flash（GLM5‑Next）模型的支持

## 为什么重要

这些新功能让用户能在自己的硬件上更快、以更少内存运行最新的 GLM 模型。

## 来源与参考

1. [ggml-org/llama.cpp b11279](https://github.com/ggml-org/llama.cpp/releases/tag/b11279) – llama.cpp, 2026-09-30
2. [add GLM-5.3-Flash (GLM5-Next) support by timkhronos · Pull Request #27773 · ggml-org/llama.cpp](https://www.reddit.com/r/LocalLLaMA/comments/1wu0bdf/add_glm53flash_glm5next_support_by_timkhronos/) – Reddit r/LocalLLaMA, 2026-09-30
3. [add GLM-5.3-Flash (GLM5-Next) support (#27773) · ggml-org/llama.cpp@649dcb1](https://www.reddit.com/r/LocalLLaMA/comments/1wu3wxu/add_glm53flash_glm5next_support_27773/) – Reddit r/LocalLLaMA, 2026-09-30

最后更新: 2026-09-30
