Das Team von ggml-org hat llama.cpp in Version b11293 veröffentlicht. Neu sind unäre BF16-Operationen (BF16 ist ein Zahlenformat mit halber Genauigkeit), GLU-, binäre und Skalierungsoperationen für CPU und CUDA. Außerdem wurden die CUDA-Kernels aktualisiert, um ein BF16-Problem beim Erstellen zu beheben. Das Update ist für zahlreiche Plattformen verfügbar, darunter macOS, Windows, Linux und Android.
Warum es wichtig ist
Entwickler können llama.cpp-Modelle nun auf BF16-fähiger Hardware wie neueren GPUs schneller ausführen.