Oossa

llama.cpp 修复 CPU 对 BF16 矩阵输入的处理

b11292 版本新增对深度卷积所用 BF16 矩阵输入的 CPU 支持,并收紧 Vulkan 的支持条件。

简讯OossaOossa 发布日期: 1 分钟阅读

llama.cpp b11292 版本修复了 CPU 后端的一项限制:当深度 1D 卷积的卷积核使用 BF16(一种 16 位数值格式)时,CPU 后端此前无法处理。现在,CPU 后端会先将该输入扩展为 32 位浮点数再进行计算,与 Metal 矩阵-向量内核采用的运算方式一致。

此版本还调整了 Vulkan 的检查条件:只有当第一个矩阵输入也是 BF16 时,才会接受作为第二个矩阵输入的 BF16。其他组合会被标记为不受支持,以便调度器将其分配给 CPU。更新说明提到新增了测试,但未说明这些改动何时会进入打包应用,也未说明哪些用户会获得这些改动。

为什么重要

对于运行 BF16 深度卷积的开发者,CPU 后端现在可以处理此前不支持的一种组合;更新说明未提及下游应用何时会包含此修复。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。