# llama.cpp 更新让索引器内存占用减半

> b11372 版本调整了 Qwen4exp 索引器，大幅降低 RAM 占用，长上下文运行时速度不受影响。

Oossa · 2026-10-03 · https://oossa.com/zh/llama-cpp-update-cuts-indexer-memory-use-in-half

ggml‑org/llama.cpp 项目于 2026 年 10 月 3 日发布 b11372 版本。此次更新重写了 Qwen4exp 索引器，让每个注意力头分别计算分数，并将结果直接写入原位。索引器分数缓冲区所需内存因此减半；在长上下文计算图中，这类缓冲区原本是内存占用最大的部分。此次改动不影响计算速度，还为 CUDA、Metal 和 Vulkan 后端新增了对 lightning 索引器的支持。

## 事实

- 版本标签 b11372 于 2026 年 10 月 3 日（星期六）发布
- 索引器分数所需内存减少约 50%

## 为什么重要

使用长上下文运行大型语言模型的开发者，可以在相同硬件上处理更长的提示词。

## 来源与参考

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

最后更新: 2026-10-03
