# llama.cpp 的 tinyBLAS 为 x86 CPU 新增 BF16/FP16 支持

> 开源库 llama.cpp 现已在 tinyBLAS 后端对 BF16、FP16 和 FP32 尾部计算进行向量化，从而提升 CPU 推理速度。

Oossa · 2026-10-04 · https://oossa.com/zh/llama-cpp-adds-bf16-fp16-support-in-tinyblas-for-x86-cpus

ggml-org 团队发布了 llama.cpp b11398 版，为 x86 平台上的 tinyBLAS CPU 后端新增 BF16、FP16 和 FP32 尾部处理支持，并对这些尾部计算进行向量化，以加快运算速度。该版本提供适用于 macOS（Apple Silicon 和 Intel）、iOS 以及多种 Ubuntu 架构的预编译二进制文件。更新还调整了测试，以确保使用参考实现时的比较结果准确。

## 事实

- 版本 b11398 于 2026 年 10 月 4 日发布
- 为 x86 平台上的 tinyBLAS 新增 BF16/FP16/FP32 尾部处理支持

## 为什么重要

开发者现在无需 GPU 加速，也能在普通 CPU 上更快地运行 LLM 推理。

## 来源与参考

1. [ggml-org/llama.cpp b11398](https://github.com/ggml-org/llama.cpp/releases/tag/b11398) – llama.cpp, 2026-10-04

最后更新: 2026-10-04
