ggml‑org 团队发布了 llama.cpp b11268 版本。此次更新修复了 OpenCL 驱动中的一个问题,该驱动负责处理 q5_K Adreno GPU 内核的张量。新版预编译二进制文件适用于 Apple Silicon Mac、Intel Mac、iOS,以及多种 Linux 配置,包括 CPU、Vulkan 和 CUDA 12.8。
为什么重要
这项修复可提升开发者在搭载 Adreno GPU 的 Android 设备上运行大语言模型时的性能和稳定性。
这款开源大语言模型运行器更新了 OpenCL 代码,修正 Adreno GPU 上的张量处理问题,并发布适用于 macOS、iOS 和 Linux 的新二进制文件。
简讯Oossa1 分钟阅读
ggml‑org 团队发布了 llama.cpp b11268 版本。此次更新修复了 OpenCL 驱动中的一个问题,该驱动负责处理 q5_K Adreno GPU 内核的张量。新版预编译二进制文件适用于 Apple Silicon Mac、Intel Mac、iOS,以及多种 Linux 配置,包括 CPU、Vulkan 和 CUDA 12.8。
这项修复可提升开发者在搭载 Adreno GPU 的 Android 设备上运行大语言模型时的性能和稳定性。
模型
OpenAI称,新版GPT‑6.1 Sol性能更强,但仍维持每百万token 2至10美元的价格,低于Anthropic的Claude和DeepSeek模型。
模型
新款v4和v4 Turbo语音的价格分别为每1,000个字符0.08美元和0.04美元;促销价持续至10月12日,分别降至0.022美元和0.011美元。
模型
Oracle推出的Fusion Claw运行时,让其Fusion应用能够处理人员排班、会计等多步骤任务:由AI负责推理,计算则交由模型之外的系统完成。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | ggml-org/llama.cpp b11268 ↗ | llama.cpp | 2026年9月30日 | <details open> opencl: fix get_tensor for q5_K adreno gemm_nonshuffle kernel (#29555) </details> **Website:** - <https://llama.app> **Attest |
1 个来源