ggml-org 团队发布了 llama.cpp b11324 版本。此次更新加入内存映射模式,加载模型时无需为每个张量再创建一份同等大小的副本。macOS(Apple Silicon 和 Intel)、iOS 以及多个 Ubuntu 版本的新二进制包均已提供此功能。发布说明还提到了 Claude 和 NVIDIA 工程师 Pranesh Gonegandla 的贡献。
为什么重要
开发者可以在同一硬件上运行更大的语言模型,这对内存有限的爱好者和小团队很有帮助。
这款开源大语言模型运行时现已支持直接映射模型数据,可在 macOS、iOS 和 Linux 版本中节省内存。
简讯OossaOossa 发布日期: 1 分钟阅读
ggml-org 团队发布了 llama.cpp b11324 版本。此次更新加入内存映射模式,加载模型时无需为每个张量再创建一份同等大小的副本。macOS(Apple Silicon 和 Intel)、iOS 以及多个 Ubuntu 版本的新二进制包均已提供此功能。发布说明还提到了 Claude 和 NVIDIA 工程师 Pranesh Gonegandla 的贡献。
开发者可以在同一硬件上运行更大的语言模型,这对内存有限的爱好者和小团队很有帮助。
最后更新: ·Markdown
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。