llama.cpp 项目于 2026 年 9 月 30 日发布新版本。此次更新新增对 GLM‑5.3‑Flash(又称 GLM5‑Next)这一新型语言模型架构的支持,还缩小了计算缓冲区、加快了长上下文解码,并修复了若干与 token 处理和 GPU 内存相关的错误。这些改动主要面向在 CPU 或 GPU 上本地运行大语言模型的开发者。
为什么重要
这些新功能让用户能在自己的硬件上更快、以更少内存运行最新的 GLM 模型。
开源大语言模型运行时 llama.cpp v0.1.0 新增对 GLM‑5.3‑Flash 的支持,并修复多项速度和内存问题。
简讯OossaOossa 发布日期: 1 分钟阅读
llama.cpp 项目于 2026 年 9 月 30 日发布新版本。此次更新新增对 GLM‑5.3‑Flash(又称 GLM5‑Next)这一新型语言模型架构的支持,还缩小了计算缓冲区、加快了长上下文解码,并修复了若干与 token 处理和 GPU 内存相关的错误。这些改动主要面向在 CPU 或 GPU 上本地运行大语言模型的开发者。
这些新功能让用户能在自己的硬件上更快、以更少内存运行最新的 GLM 模型。
最后更新: ·Markdown
模型
约100家网站因内容被用于 AI Overviews、AI Mode 和 Gemini 而获得报酬,但大多数收入不足1,000美元,也不知道报酬如何计算。
模型
OpenAI称,新版GPT‑6.1 Sol性能更强,但仍维持每百万token 2至10美元的价格,低于Anthropic的Claude和DeepSeek模型。
模型
新款v4和v4 Turbo语音的价格分别为每1,000个字符0.08美元和0.04美元;促销价持续至10月12日,分别降至0.022美元和0.011美元。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。