# llama.cpp 新版加入内存映射选项，减少张量复制

> 这款开源大语言模型运行时现已支持直接映射模型数据，可在 macOS、iOS 和 Linux 版本中节省内存。

Oossa · 2026-10-01 · https://oossa.com/zh/llama-cpp-release-adds-memory-map-option-to-cut-tensor-copies

ggml-org 团队发布了 llama.cpp b11324 版本。此次更新加入内存映射模式，加载模型时无需为每个张量再创建一份同等大小的副本。macOS（Apple Silicon 和 Intel）、iOS 以及多个 Ubuntu 版本的新二进制包均已提供此功能。发布说明还提到了 Claude 和 NVIDIA 工程师 Pranesh Gonegandla 的贡献。

## 事实

- b11324 版本于 2026-10-01 发布
- 新增 llama-mmap 功能以减少 RAM 占用

## 为什么重要

开发者可以在同一硬件上运行更大的语言模型，这对内存有限的爱好者和小团队很有帮助。

## 来源与参考

1. [ggml-org/llama.cpp b11324](https://github.com/ggml-org/llama.cpp/releases/tag/b11324) – llama.cpp, 2026-10-01

最后更新: 2026-10-01
