Oossa

llama.cpp 新版加入内存映射选项,减少张量复制

这款开源大语言模型运行时现已支持直接映射模型数据,可在 macOS、iOS 和 Linux 版本中节省内存。

简讯OossaOossa 发布日期: 1 分钟阅读

ggml-org 团队发布了 llama.cpp b11324 版本。此次更新加入内存映射模式,加载模型时无需为每个张量再创建一份同等大小的副本。macOS(Apple Silicon 和 Intel)、iOS 以及多个 Ubuntu 版本的新二进制包均已提供此功能。发布说明还提到了 Claude 和 NVIDIA 工程师 Pranesh Gonegandla 的贡献。

为什么重要

开发者可以在同一硬件上运行更大的语言模型,这对内存有限的爱好者和小团队很有帮助。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。