Das Release llama.cpp b11292 behebt eine Einschränkung des CPU-Backends bei der eindimensionalen Depthwise-Convolution, wenn deren Kernel BF16 verwendet, ein 16-Bit-Zahlenformat. Das CPU-Backend erweitert diese Eingabe für die Berechnung nun auf 32-Bit-Gleitkommazahlen. Damit entspricht die Arithmetik derjenigen des Metal-Matrix-Vektor-Kernels.
Außerdem ändert das Release die Vulkan-Prüfungen: BF16 wird als zweite Matrixeingabe nur akzeptiert, wenn auch die erste Eingabe BF16 ist. Andere Kombinationen werden als nicht unterstützt eingestuft, sodass der Scheduler sie auf der CPU ausführt. Die Versionshinweise erwähnen neue Tests, sagen aber nicht, wann die Änderungen in einer gebündelten App verfügbar sein werden oder welche Nutzer sie erhalten.
Warum es wichtig ist
Für Entwickler, die BF16-Depthwise-Convolution ausführen, kann das CPU-Backend nun eine Kombination verarbeiten, die es zuvor abgelehnt hat. Die Versionshinweise nennen nicht, wann nachgelagerte Apps den Fix enthalten werden.