# llama.cpp 更新修复忙碌槽位被覆盖的问题

> 2026年10月10日发布的版本修复了一项错误：新请求改写提示缓存，可能导致正在进行的生成出错。

Oossa · 2026-10-10 · https://oossa.com/zh/llama-cpp-update-stops-overwriting-busy-slots

llama.cpp 项目于2026‑10‑10发布 b11552 版本。此次更新可防止请求修改已处于忙碌状态的槽位的提示缓存。此前，忙碌槽位会被覆盖，导致生成过程继续使用错误的上下文。现在，忙碌槽位会保持原样返回，新请求则会等待槽位空闲后再处理。

## 事实

- b11552 版本于2026年10月10日（星期六）发布
- 此修复可防止更新繁忙的 id_slot 的提示缓存

## 为什么重要

使用 llama.cpp 的开发者在多个请求共用同一块 GPU 内存时，将遇到更少的生成错误。

## 来源与参考

1. [ggml-org/llama.cpp b11552](https://github.com/ggml-org/llama.cpp/releases/tag/b11552) – llama.cpp, 2026-10-10

最后更新: 2026-10-10
