Het team van ggml-org heeft versie b11293 van llama.cpp uitgebracht. Deze voegt uniaire, GLU-, binaire en schaalbewerkingen met BF16 (een getalnotatie met halve precisie) toe voor zowel CPU als CUDA. Ook zijn de CUDA-kernels bijgewerkt om een probleem bij het bouwen met BF16 op te lossen. De update is beschikbaar voor allerlei platforms, van macOS en Windows tot Linux en Android.
Waarom het ertoe doet
Ontwikkelaars kunnen llama.cpp-modellen nu sneller draaien op hardware die BF16 ondersteunt, zoals nieuwere GPU's.