El equipo de ggml-org publicó la versión b11293 de llama.cpp. Incorpora operaciones unarias, GLU, binarias y de escalado con BF16 (un formato numérico de media precisión), tanto para CPU como para CUDA. La actualización también modifica los kernels de CUDA para corregir un problema de compilación relacionado con BF16. Está disponible para numerosas plataformas, desde macOS y Windows hasta Linux y Android.
Por qué importa
Los desarrolladores ahora pueden ejecutar modelos de llama.cpp más rápido en hardware compatible con BF16, como las GPU más recientes.