Oossa

llama.cpp 为 MoE 专家新增 GPU 缓存

开源库 llama.cpp 现可将混合专家(MoE)数据缓存在主机内存中的 GPU 缓存里。

简讯作者: Oossa 发布日期: 最后更新: 1 分钟阅读

ggml‑org 团队于 2026‑10‑08 发布 llama.cpp b11480 版本。此次更新为 MoE 专家新增了位于主机内存中的 GPU 缓存,有助于大型模型在 GPU 上运行得更快。这项改动标注为 assisted‑by Claude,并采用了新的 llama_moe_cache_ptr API。macOS、iOS 和多种 Ubuntu 配置的预编译二进制文件现已开放下载。

为什么重要

开发者现在可以在消费级 GPU 上更高效地运行 MoE 模型,从而降低 AI 项目的硬件成本。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。