A equipe ggml-org lançou a versão b11293 do llama.cpp. A atualização adiciona operações unárias, GLU, binárias e de escala com BF16 (um formato numérico de meia precisão) para CPU e CUDA. Também atualiza os kernels CUDA para corrigir um problema de compilação relacionado ao BF16. A atualização está disponível em diversas plataformas, de macOS e Windows a Linux e Android.
Por que importa
Desenvolvedores podem executar modelos do llama.cpp com mais rapidez em hardware compatível com BF16, como GPUs mais recentes.