Teamet bakom ggml-org har släppt llama.cpp version b11293. Uppdateringen lägger till unära BF16-operationer, GLU, binära operationer och skalningsoperationer för både CPU och CUDA. Den uppdaterar också CUDA-kärnorna för att åtgärda ett byggproblem med BF16. Uppdateringen finns för många plattformar, från macOS och Windows till Linux och Android.
Varför det spelar roll
Utvecklare kan nu köra llama.cpp-modeller snabbare på hårdvara med stöd för BF16, till exempel nyare GPU:er.