ggml-org团队于2026-10-09发布llama.cpp b11528版。此次更新让该库可以将主机分配张量的视图视为普通节点,从而避免使用–split-mode tensor选项时出现此前的断言错误。此外,更新还重新加入了对K2 Horizon加速器的SM张量支持。相关改动已包含在GitHub官方版本中,适用于列出的所有平台,包括macOS、Windows和Linux。
为什么重要
开发者现在可以在更多硬件上使用拆分模式KV缓存运行llama.cpp,而不会遭遇崩溃,从而为本地LLM推理提供更多可用配置。