Oossa

llama.cpp 更新:支持 GLM‑5.3‑Flash 并优化性能

开源大语言模型运行时 llama.cpp v0.1.0 新增对 GLM‑5.3‑Flash 的支持,并修复多项速度和内存问题。

简讯OossaOossa 发布日期: 1 分钟阅读

llama.cpp 项目于 2026 年 9 月 30 日发布新版本。此次更新新增对 GLM‑5.3‑Flash(又称 GLM5‑Next)这一新型语言模型架构的支持,还缩小了计算缓冲区、加快了长上下文解码,并修复了若干与 token 处理和 GPU 内存相关的错误。这些改动主要面向在 CPU 或 GPU 上本地运行大语言模型的开发者。

为什么重要

这些新功能让用户能在自己的硬件上更快、以更少内存运行最新的 GLM 模型。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。