De release llama.cpp b11292 verhelpt een beperking van de CPU-backend bij depthwise 1D-convolutie met een BF16-kernel, een getalnotatie van 16 bits. De CPU-backend zet die invoer nu om naar 32-bit float voor de berekening, net als de matrix-vector-kernel van Metal.
De release past ook de controles van Vulkan aan: BF16 wordt alleen als tweede matrixinvoer geaccepteerd als de eerste invoer ook BF16 is. Andere combinaties worden als niet-ondersteund gemarkeerd, zodat de scheduler ze op de CPU uitvoert. In de release notes staan nieuwe tests vermeld, maar er staat niet wanneer de wijzigingen in een verpakte app terechtkomen of welke gebruikers ze zullen ontvangen.
Waarom het ertoe doet
Ontwikkelaars die BF16-depthwise-convolutie uitvoeren, kunnen nu op de CPU-backend een combinatie verwerken die daar eerder werd geweigerd. De release notes vermelden niet wanneer apps van derden de oplossing zullen bevatten.