OossaAI 发展迅速。我们用简单的话讲清楚。

llama.cpp b11262版新增 AVX512-FP16 点积支持

开源库 llama.cpp 现可使用 AVX512-FP16,以全精度计算半精度点积,提升 CPU 性能。

简讯Oossa1 分钟阅读

ggml-org 团队于 2026 年 9 月 29 日发布 llama.cpp b11262 版。此次更新新增 AVX512-FP16 支持,可计算半精度(f16)点积,并以单精度(f32)累加结果,从而提高精度。这项底层改动可加快支持 AVX512-FP16 指令集的 CPU 上的推理速度。该版本还附带适用于 macOS、iOS 和多个 Linux 构建版本的新二进制文件。

为什么重要

开发者可以在现代 CPU 上更快地运行大语言模型,同时不损失数值精度。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。

来源与参考

#来源发布方日期要点
1ggml-org/llama.cpp b11262 ↗llama.cpp2026年9月29日<details open> ggml : accumulate f16 dot products in f32 on AVX512-FP16 (#29545) Supersedes #29530 Signed-off-by: Adrien Gallouët <angt@hugg

1 个来源

最后更新: ·Markdown·llms.txt