ggml-org/llama.cpp 项目于 2026-10-02 发布 b11351 版本。此次更新在 ggml_backend_buffer_type_i 接口中新增 alloc_buffer_n 方法,并提供名为 ggml_backend_buft_alloc_buffer_n 的公共 API。默认实现现在支持将缓冲区拆分到多个设备,并改进张量分配。CPU、Metal、OpenVINO 等现有缓冲区类型会为这一新方法提供 NULL 占位符。此次更新还新增了相关测试。
为什么重要
开发者现在可以在不同硬件上更可靠地管理内存,减少 AI 模型分配内存时出错的情况。