Oossa

llama.cpp 新增多 GPU MoE 缓存支持

开源库 Llama.cpp 现支持在多块 GPU 上运行混合专家模型。

简讯作者: Oossa 发布日期: 1 分钟阅读

ggml‑org 团队于 October 8, 2026 发布 llama.cpp b11507 版本。此次更新新增了可分布在多块 GPU 上的混合专家(MoE)缓存支持,让开发者无需将模型全部装入单块显卡,就能运行更大的 MoE 模型。该版本还为 macOS、iOS 和多种 Linux 配置推出了新的二进制软件包,其中包括 CUDA 12.8 支持。

为什么重要

开发者现在可以在多 GPU 设备上运行规模更大、能力更强的 AI 模型,拓展个人硬件的用途。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。