ggml‑org/llama.cpp 项目于 2026‑10‑09 发布 b11530 版本。此次更新让后端采样图在不同 ubatch 间保持静态,因此图结构在 reserve 和 decode 阶段不再变化。这修复了因 reserve 构建完成后图拓扑发生变化而导致的崩溃。该修复适用于所有列出的构建版本——macOS、Linux、Android、Windows 和 openEuler,也适用于 CUDA、Vulkan 和 OpenCL 等所有硬件后端。
为什么重要
在任何受支持的 CPU 或 GPU 上运行多输出生成任务时,llama.cpp 开发者遇到的运行时错误会减少。