# llama.cpp 新增多 GPU MoE 缓存支持

> 开源库 Llama.cpp 现支持在多块 GPU 上运行混合专家模型。

Oossa · 2026-10-08 · https://oossa.com/zh/llama-cpp-adds-multi-gpu-moe-cache-support

ggml‑org 团队于 October 8, 2026 发布 llama.cpp b11507 版本。此次更新新增了可分布在多块 GPU 上的混合专家（MoE）缓存支持，让开发者无需将模型全部装入单块显卡，就能运行更大的 MoE 模型。该版本还为 macOS、iOS 和多种 Linux 配置推出了新的二进制软件包，其中包括 CUDA 12.8 支持。

## 事实

- b11507 版本于 2026-10-08 发布
- 新增跨多块 GPU 的 MoE 缓存支持

## 为什么重要

开发者现在可以在多 GPU 设备上运行规模更大、能力更强的 AI 模型，拓展个人硬件的用途。

## 来源与参考

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

最后更新: 2026-10-08
