llama.cpp 项目于2026‑10‑08发布 b11490 版本。该版本支持 Hexagon 的“alloc_buffer_n” API,可将大型张量拆分到多个缓冲区中。默认动态缓冲区大小从128 MB提高至512 MB,以避免运行大型模型时性能下降。新增的“--no-embd-offload”标志可简化无法卸载嵌入层的设备所需的命令行参数。这些改动由 Jhen‑Jie Hong 共同完成。
为什么重要
使用基于 Hexagon 的硬件的开发者无需手动调整缓冲区,就能更高效地运行更大的语言模型。