A versão b11292 do llama.cpp corrige uma limitação do backend de CPU que afetava a convolução depthwise 1D quando o kernel usa BF16, um formato numérico de 16 bits. Agora, o backend de CPU converte essa entrada para ponto flutuante de 32 bits durante o cálculo, usando a mesma aritmética do kernel de multiplicação matriz-vetor do Metal.
A versão também altera as verificações do Vulkan: ele aceita BF16 como segunda entrada da matriz somente quando a primeira também é BF16. As demais combinações são marcadas como incompatíveis, para que o escalonador as mantenha na CPU. As notas mencionam a inclusão de testes, mas não informam quando as mudanças chegarão a um aplicativo distribuído nem quais usuários terão acesso a elas.
Por que importa
Para desenvolvedores que executam convolução depthwise em BF16, o backend de CPU agora pode processar uma combinação que antes rejeitava; as notas não especificam quando aplicativos derivados incluirão a correção.