ggml-org 团队于 2026 年 9 月 29 日发布 llama.cpp b11262 版。此次更新新增 AVX512-FP16 支持,可计算半精度(f16)点积,并以单精度(f32)累加结果,从而提高精度。这项底层改动可加快支持 AVX512-FP16 指令集的 CPU 上的推理速度。该版本还附带适用于 macOS、iOS 和多个 Linux 构建版本的新二进制文件。
为什么重要
开发者可以在现代 CPU 上更快地运行大语言模型,同时不损失数值精度。
开源库 llama.cpp 现可使用 AVX512-FP16,以全精度计算半精度点积,提升 CPU 性能。
简讯Oossa1 分钟阅读
ggml-org 团队于 2026 年 9 月 29 日发布 llama.cpp b11262 版。此次更新新增 AVX512-FP16 支持,可计算半精度(f16)点积,并以单精度(f32)累加结果,从而提高精度。这项底层改动可加快支持 AVX512-FP16 指令集的 CPU 上的推理速度。该版本还附带适用于 macOS、iOS 和多个 Linux 构建版本的新二进制文件。
开发者可以在现代 CPU 上更快地运行大语言模型,同时不损失数值精度。
模型
OpenAI称,新版GPT‑6.1 Sol性能更强,但仍维持每百万token 2至10美元的价格,低于Anthropic的Claude和DeepSeek模型。
模型
新款v4和v4 Turbo语音的价格分别为每1,000个字符0.08美元和0.04美元;促销价持续至10月12日,分别降至0.022美元和0.011美元。
模型
Oracle推出的Fusion Claw运行时,让其Fusion应用能够处理人员排班、会计等多步骤任务:由AI负责推理,计算则交由模型之外的系统完成。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | ggml-org/llama.cpp b11262 ↗ | llama.cpp | 2026年9月29日 | <details open> ggml : accumulate f16 dot products in f32 on AVX512-FP16 (#29545) Supersedes #29530 Signed-off-by: Adrien Gallouët <angt@hugg |
1 个来源