llama.cpp 项目于2026‑10‑10发布 b11552 版本。此次更新可防止请求修改已处于忙碌状态的槽位的提示缓存。此前,忙碌槽位会被覆盖,导致生成过程继续使用错误的上下文。现在,忙碌槽位会保持原样返回,新请求则会等待槽位空闲后再处理。
为什么重要
使用 llama.cpp 的开发者在多个请求共用同一块 GPU 内存时,将遇到更少的生成错误。
2026年10月10日发布的版本修复了一项错误:新请求改写提示缓存,可能导致正在进行的生成出错。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
llama.cpp 项目于2026‑10‑10发布 b11552 版本。此次更新可防止请求修改已处于忙碌状态的槽位的提示缓存。此前,忙碌槽位会被覆盖,导致生成过程继续使用错误的上下文。现在,忙碌槽位会保持原样返回,新请求则会等待槽位空闲后再处理。
使用 llama.cpp 的开发者在多个请求共用同一块 GPU 内存时,将遇到更少的生成错误。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。