El equipo de ggml-org publicó la versión b11494 de llama.cpp. La actualización modifica el backend de CUDA para asignar cuatro columnas de estado GDN por warp, en lugar de dos. Este ajuste ahora viene activado de forma predeterminada. Se pueden descargar binarios para macOS (Apple Silicon e Intel), iOS y varias versiones de Ubuntu.
Por qué importa
Los desarrolladores que usan llama.cpp en GPU NVIDIA pueden esperar una inferencia más rápida sin cambiar su código.