# llama.cpp corrige o suporte da CPU a matrizes BF16

> A versão b11292 adiciona suporte da CPU a uma entrada de matriz BF16 usada em convolução depthwise e torna mais rigorosas as verificações de suporte do Vulkan.

Oossa · 2026-09-30 · https://oossa.com/pt/llama-cpp-fixes-cpu-handling-for-bf16-matrix-inputs

Produzido e traduzido com auxílio de IA. Consulte as fontes originais abaixo.

A versão b11292 do llama.cpp corrige uma limitação do backend de CPU que afetava a convolução depthwise 1D quando o kernel usa BF16, um formato numérico de 16 bits. Agora, o backend de CPU converte essa entrada para ponto flutuante de 32 bits durante o cálculo, usando a mesma aritmética do kernel de multiplicação matriz-vetor do Metal.

A versão também altera as verificações do Vulkan: ele aceita BF16 como segunda entrada da matriz somente quando a primeira também é BF16. As demais combinações são marcadas como incompatíveis, para que o escalonador as mantenha na CPU. As notas mencionam a inclusão de testes, mas não informam quando as mudanças chegarão a um aplicativo distribuído nem quais usuários terão acesso a elas.

## Os fatos

- A versão é llama.cpp b11292, publicada em 30 de setembro de 2026.
- As notas abrangem um teste de convolução depthwise com kernels F32, F16 e BF16, além de três casos de multiplicação de matrizes com BF16 como segunda entrada.

## Por que importa

Para desenvolvedores que executam convolução depthwise em BF16, o backend de CPU agora pode processar uma combinação que antes rejeitava; as notas não especificam quando aplicativos derivados incluirão a correção.

## Fontes e referências

1. [ggml-org/llama.cpp b11292](https://github.com/ggml-org/llama.cpp/releases/tag/b11292) – llama.cpp, 2026-09-30

Última atualização: 2026-09-30
