Version llama.cpp b11292 åtgärdar en begränsning i CPU-bakänden som påverkar djupvis 1D-konvolution när kärnan använder BF16, ett 16-bitars talformat. CPU-bakänden konverterar nu indatan till 32-bitars flyttal inför beräkningen, så att den använder samma aritmetik som Metal-kärnan för matris-vektorberäkningar.
Versionen ändrar också Vulkan-kontrollerna: BF16 godtas som den andra matrisindatan endast när även den första indatan är BF16. Övriga kombinationer markeras som ej stödda, så schemaläggaren låter CPU:n hantera dem. Versionsinformationen nämner nya tester, men anger inte när ändringarna kommer till en paketerad app eller vilka användare som får dem.
Varför det spelar roll
För utvecklare som kör djupvis konvolution med BF16 kan CPU-bakänden nu hantera en kombination som den tidigare avvisade. Versionsinformationen anger inte när korrigeringen kommer att ingå i appar som bygger på llama.cpp.