El equipo de ggml-org publicó una nueva versión de llama.cpp el 30 de septiembre de 2026. La actualización corrige un problema por el que el controlador de la GPU MUSA no definía CUDA_ARCH, lo que hacía que algunos kernels se compilaran vacíos. El parche añade la detección correcta de la arquitectura y elimina comprobaciones redundantes. La versión también incluye numerosos binarios precompilados, ahora para CUDA 12.8 y 13.4 en Linux y Windows, además de compatibilidad con varios objetivos ARM y Apple Silicon.
Por qué importa
Los desarrolladores ahora pueden ejecutar Llama.cpp en GPU MUSA y con versiones más recientes de CUDA sin aplicar parches manualmente.