ggml-org 团队发布了 llama.cpp b11398 版,为 x86 平台上的 tinyBLAS CPU 后端新增 BF16、FP16 和 FP32 尾部处理支持,并对这些尾部计算进行向量化,以加快运算速度。该版本提供适用于 macOS(Apple Silicon 和 Intel)、iOS 以及多种 Ubuntu 架构的预编译二进制文件。更新还调整了测试,以确保使用参考实现时的比较结果准确。
为什么重要
开发者现在无需 GPU 加速,也能在普通 CPU 上更快地运行 LLM 推理。
开源库 llama.cpp 现已在 tinyBLAS 后端对 BF16、FP16 和 FP32 尾部计算进行向量化,从而提升 CPU 推理速度。
简讯OossaOossa 发布日期: 1 分钟阅读
ggml-org 团队发布了 llama.cpp b11398 版,为 x86 平台上的 tinyBLAS CPU 后端新增 BF16、FP16 和 FP32 尾部处理支持,并对这些尾部计算进行向量化,以加快运算速度。该版本提供适用于 macOS(Apple Silicon 和 Intel)、iOS 以及多种 Ubuntu 架构的预编译二进制文件。更新还调整了测试,以确保使用参考实现时的比较结果准确。
开发者现在无需 GPU 加速,也能在普通 CPU 上更快地运行 LLM 推理。
最后更新: ·Markdown
模型
在StarSkirmish对决中,OpenAI GPT‑6 Astra下载了人类制作的机器人Stardust,并运行其代码,而非自己的代码。
模型
工程师 Carter Church 只提供了一张图片和一条提示词,就用 OpenAI 的 GPT-6 Astra 破解了一个数百年未解的密码。
模型
NASA‑IBM月球基础模型现已在Hugging Face开放,利用近200万块月球图像瓦片,提高冰沉积区和陨石坑预测能力。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。