# llama.cpp 为 MoE 专家新增 GPU 缓存

> 开源库 llama.cpp 现可将混合专家（MoE）数据缓存在主机内存中的 GPU 缓存里。

Oossa · 2026-10-08 · https://oossa.com/zh/llama-cpp-adds-gpu-cache-for-moe-experts

ggml‑org 团队于 2026‑10‑08 发布 llama.cpp b11480 版本。此次更新为 MoE 专家新增了位于主机内存中的 GPU 缓存，有助于大型模型在 GPU 上运行得更快。这项改动标注为 assisted‑by Claude，并采用了新的 llama_moe_cache_ptr API。macOS、iOS 和多种 Ubuntu 配置的预编译二进制文件现已开放下载。

## 事实

- 发布版本：b11480
- 发布日期：2026‑10‑08

## 为什么重要

开发者现在可以在消费级 GPU 上更高效地运行 MoE 模型，从而降低 AI 项目的硬件成本。

## 来源与参考

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

最后更新: 2026-10-08
