Il team ggml-org ha rilasciato la versione b11293 di llama.cpp. L’aggiornamento aggiunge operazioni unarie, GLU, binarie e di scalatura con il formato BF16 (un formato numerico a precisione ridotta) per CPU e CUDA. Aggiorna inoltre i kernel CUDA per risolvere un problema di compilazione relativo a BF16. La nuova versione è disponibile su molte piattaforme, da macOS e Windows a Linux e Android.
Perché conta
Gli sviluppatori possono eseguire più velocemente i modelli llama.cpp sui dispositivi che supportano BF16, come le GPU più recenti.