Oossa

llama.cpp corrige o suporte da CPU a matrizes BF16

A versão b11292 adiciona suporte da CPU a uma entrada de matriz BF16 usada em convolução depthwise e torna mais rigorosas as verificações de suporte do Vulkan.

NotaOossaPublicado pelo Oossa: 1 min de leitura

A versão b11292 do llama.cpp corrige uma limitação do backend de CPU que afetava a convolução depthwise 1D quando o kernel usa BF16, um formato numérico de 16 bits. Agora, o backend de CPU converte essa entrada para ponto flutuante de 32 bits durante o cálculo, usando a mesma aritmética do kernel de multiplicação matriz-vetor do Metal.

A versão também altera as verificações do Vulkan: ele aceita BF16 como segunda entrada da matriz somente quando a primeira também é BF16. As demais combinações são marcadas como incompatíveis, para que o escalonador as mantenha na CPU. As notas mencionam a inclusão de testes, mas não informam quando as mudanças chegarão a um aplicativo distribuído nem quais usuários terão acesso a elas.

Por que importa

Para desenvolvedores que executam convolução depthwise em BF16, o backend de CPU agora pode processar uma combinação que antes rejeitava; as notas não especificam quando aplicativos derivados incluirão a correção.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.