OossaAI 发展迅速。我们用简单的话讲清楚。

llama.cpp v0.2.0 预发布版加入 Hexagon CPU 优化

这款开源大语言模型运行器更新了 Hexagon 后端,可加快骁龙芯片上的拼接操作。

简讯Oossa1 分钟阅读

ggml‑org/llama.cpp 项目于 2026 年 9 月 30 日发布预发布版本(标签 b11272)。该版本针对拼接操作加入了 Hexagon 专属优化。拼接是语言模型推理中的常见步骤。此次改动减少了数据包开销,并采用更快的除法例程,加快了负责搬运数据的热点循环。此次更新是面向多个平台的一系列构建版本之一,涵盖搭载 Hexagon NPU 的 Android 骁龙设备。

为什么重要

这能显著提升在骁龙手机上运行大语言模型的速度,降低设备端 AI 任务的延迟。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。

来源与参考

#来源发布方日期要点
1ggml-org/llama.cpp b11272 ↗llama.cpp2026年9月30日<details open> hexagon: optimize concat op (#29673) * hex-concat: reduce pkts in gather/transpose hot loop gather directly into dst buffer,

1 个来源

最后更新: ·Markdown·llms.txt