开源库 llama.cpp 为支持 MoE 的矩阵乘法加入了一项 Vulkan 修复。此次改动调整了代码为 mat_mul_id 操作选择分块大小的方式,使其与每位专家实际激活的行数相匹配。在一项针对 300 亿参数模型的测试中,这项修复减少了 GPU 空转;此前空转占运行时间的 55%。
为什么重要
减少 GPU 空转时间,意味着在兼容 Vulkan 的硬件上运行大型 MoE 模型时,推理速度更快。
2026 年 9 月 30 日发布的更新调整了 Vulkan 分块选择,减少混合专家模型中的无效计算。
简讯Oossa1 分钟阅读
开源库 llama.cpp 为支持 MoE 的矩阵乘法加入了一项 Vulkan 修复。此次改动调整了代码为 mat_mul_id 操作选择分块大小的方式,使其与每位专家实际激活的行数相匹配。在一项针对 300 亿参数模型的测试中,这项修复减少了 GPU 空转;此前空转占运行时间的 55%。
减少 GPU 空转时间,意味着在兼容 Vulkan 的硬件上运行大型 MoE 模型时,推理速度更快。
模型
OpenAI称,新版GPT‑6.1 Sol性能更强,但仍维持每百万token 2至10美元的价格,低于Anthropic的Claude和DeepSeek模型。
模型
新款v4和v4 Turbo语音的价格分别为每1,000个字符0.08美元和0.04美元;促销价持续至10月12日,分别降至0.022美元和0.011美元。
模型
Oracle推出的Fusion Claw运行时,让其Fusion应用能够处理人员排班、会计等多步骤任务:由AI负责推理,计算则交由模型之外的系统完成。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | ggml-org/llama.cpp b11265 ↗ | llama.cpp | 2026年9月29日 | <details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count. |
1 个来源