# llama.cpp b11351 发布：新增缓冲区分配 API

> 2026 年 10 月 2 日的更新为 ggml 缓冲区接口引入 alloc_buffer_n，改进多设备内存管理。

Oossa · 2026-10-02 · https://oossa.com/zh/llama-cpp-adds-new-buffer-allocation-api-in-b11351-release

ggml-org/llama.cpp 项目于 2026-10-02 发布 b11351 版本。此次更新在 ggml_backend_buffer_type_i 接口中新增 alloc_buffer_n 方法，并提供名为 ggml_backend_buft_alloc_buffer_n 的公共 API。默认实现现在支持将缓冲区拆分到多个设备，并改进张量分配。CPU、Metal、OpenVINO 等现有缓冲区类型会为这一新方法提供 NULL 占位符。此次更新还新增了相关测试。

## 事实

- b11351 版本于 2026-10-02 发布
- ggml 缓冲区接口新增 alloc_buffer_n 方法

## 为什么重要

开发者现在可以在不同硬件上更可靠地管理内存，减少 AI 模型分配内存时出错的情况。

## 来源与参考

1. [ggml-org/llama.cpp b11351](https://github.com/ggml-org/llama.cpp/releases/tag/b11351) – llama.cpp, 2026-10-02

最后更新: 2026-10-02
