ggml‑org/llama.cpp 项目于 2026 年 9 月 30 日发布预发布版本(标签 b11272)。该版本针对拼接操作加入了 Hexagon 专属优化。拼接是语言模型推理中的常见步骤。此次改动减少了数据包开销,并采用更快的除法例程,加快了负责搬运数据的热点循环。此次更新是面向多个平台的一系列构建版本之一,涵盖搭载 Hexagon NPU 的 Android 骁龙设备。
为什么重要
这能显著提升在骁龙手机上运行大语言模型的速度,降低设备端 AI 任务的延迟。
这款开源大语言模型运行器更新了 Hexagon 后端,可加快骁龙芯片上的拼接操作。
简讯Oossa1 分钟阅读
ggml‑org/llama.cpp 项目于 2026 年 9 月 30 日发布预发布版本(标签 b11272)。该版本针对拼接操作加入了 Hexagon 专属优化。拼接是语言模型推理中的常见步骤。此次改动减少了数据包开销,并采用更快的除法例程,加快了负责搬运数据的热点循环。此次更新是面向多个平台的一系列构建版本之一,涵盖搭载 Hexagon NPU 的 Android 骁龙设备。
这能显著提升在骁龙手机上运行大语言模型的速度,降低设备端 AI 任务的延迟。
模型
OpenAI称,新版GPT‑6.1 Sol性能更强,但仍维持每百万token 2至10美元的价格,低于Anthropic的Claude和DeepSeek模型。
模型
新款v4和v4 Turbo语音的价格分别为每1,000个字符0.08美元和0.04美元;促销价持续至10月12日,分别降至0.022美元和0.011美元。
模型
Oracle推出的Fusion Claw运行时,让其Fusion应用能够处理人员排班、会计等多步骤任务:由AI负责推理,计算则交由模型之外的系统完成。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | ggml-org/llama.cpp b11272 ↗ | llama.cpp | 2026年9月30日 | <details open> hexagon: optimize concat op (#29673) * hex-concat: reduce pkts in gather/transpose hot loop gather directly into dst buffer, |
1 个来源