ggml‑org 团队发布了 llama.cpp b11489 版本。根据发行说明,此次更新加快了 Q6_K 权重反量化——即将压缩的模型权重还原为可用数值的步骤——并将循环展开因子加倍。现在还提供了适用于 Apple Silicon、Intel macOS、iOS,以及多种 Ubuntu 配置的预编译二进制文件,其中包括 Vulkan 和 CUDA 版本。
为什么重要
反量化速度提升后,开发者可在相同硬件上以更低延迟运行大语言模型。
b11489 版本提升 Q6_K 权重反量化速度,并增加循环展开;现已提供适用于 macOS、iOS 和 Linux 的预编译二进制文件。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
ggml‑org 团队发布了 llama.cpp b11489 版本。根据发行说明,此次更新加快了 Q6_K 权重反量化——即将压缩的模型权重还原为可用数值的步骤——并将循环展开因子加倍。现在还提供了适用于 Apple Silicon、Intel macOS、iOS,以及多种 Ubuntu 配置的预编译二进制文件,其中包括 Vulkan 和 CUDA 版本。
反量化速度提升后,开发者可在相同硬件上以更低延迟运行大语言模型。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。