Oossa

llama.cpp 更新让索引器内存占用减半

b11372 版本调整了 Qwen4exp 索引器,大幅降低 RAM 占用,长上下文运行时速度不受影响。

简讯OossaOossa 发布日期: 1 分钟阅读

ggml‑org/llama.cpp 项目于 2026 年 10 月 3 日发布 b11372 版本。此次更新重写了 Qwen4exp 索引器,让每个注意力头分别计算分数,并将结果直接写入原位。索引器分数缓冲区所需内存因此减半;在长上下文计算图中,这类缓冲区原本是内存占用最大的部分。此次改动不影响计算速度,还为 CUDA、Metal 和 Vulkan 后端新增了对 lightning 索引器的支持。

为什么重要

使用长上下文运行大型语言模型的开发者,可以在相同硬件上处理更长的提示词。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。