Oossa

llama.cpp 的 tinyBLAS 为 x86 CPU 新增 BF16/FP16 支持

开源库 llama.cpp 现已在 tinyBLAS 后端对 BF16、FP16 和 FP32 尾部计算进行向量化,从而提升 CPU 推理速度。

简讯OossaOossa 发布日期: 1 分钟阅读

ggml-org 团队发布了 llama.cpp b11398 版,为 x86 平台上的 tinyBLAS CPU 后端新增 BF16、FP16 和 FP32 尾部处理支持,并对这些尾部计算进行向量化,以加快运算速度。该版本提供适用于 macOS(Apple Silicon 和 Intel)、iOS 以及多种 Ubuntu 架构的预编译二进制文件。更新还调整了测试,以确保使用参考实现时的比较结果准确。

为什么重要

开发者现在无需 GPU 加速,也能在普通 CPU 上更快地运行 LLM 推理。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。