Oossa

llama.cpp b11489 加快 Q6_K 权重反量化

b11489 版本提升 Q6_K 权重反量化速度,并增加循环展开;现已提供适用于 macOS、iOS 和 Linux 的预编译二进制文件。

简讯作者: Oossa 发布日期: 1 分钟阅读

ggml‑org 团队发布了 llama.cpp b11489 版本。根据发行说明,此次更新加快了 Q6_K 权重反量化——即将压缩的模型权重还原为可用数值的步骤——并将循环展开因子加倍。现在还提供了适用于 Apple Silicon、Intel macOS、iOS,以及多种 Ubuntu 配置的预编译二进制文件,其中包括 Vulkan 和 CUDA 版本。

为什么重要

反量化速度提升后,开发者可在相同硬件上以更低延迟运行大语言模型。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。