ggml‑org 团队于 2026‑10‑08 发布 llama.cpp b11480 版本。此次更新为 MoE 专家新增了位于主机内存中的 GPU 缓存,有助于大型模型在 GPU 上运行得更快。这项改动标注为 assisted‑by Claude,并采用了新的 llama_moe_cache_ptr API。macOS、iOS 和多种 Ubuntu 配置的预编译二进制文件现已开放下载。
为什么重要
开发者现在可以在消费级 GPU 上更高效地运行 MoE 模型,从而降低 AI 项目的硬件成本。
开源库 llama.cpp 现可将混合专家(MoE)数据缓存在主机内存中的 GPU 缓存里。
简讯作者: OossaOossa 发布日期: 最后更新: 1 分钟阅读
ggml‑org 团队于 2026‑10‑08 发布 llama.cpp b11480 版本。此次更新为 MoE 专家新增了位于主机内存中的 GPU 缓存,有助于大型模型在 GPU 上运行得更快。这项改动标注为 assisted‑by Claude,并采用了新的 llama_moe_cache_ptr API。macOS、iOS 和多种 Ubuntu 配置的预编译二进制文件现已开放下载。
开发者现在可以在消费级 GPU 上更高效地运行 MoE 模型,从而降低 AI 项目的硬件成本。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。