El proyecto llama.cpp publicó una nueva versión preliminar, b11517, el 9 de octubre de 2026. La actualización añade una opción de CUDA que permite indicar la precisión de source-1 a los helpers MMQ, un componente de bajo nivel del código para GPU. El cambio lleva la firma de un colaborador de NVIDIA y se aplica a las compilaciones con CUDA 12 y 13 para Linux y Windows. La versión también incluye objetivos de compilación para muchas otras plataformas, desde macOS con Apple Silicon hasta Android con Snapdragon.
La actualización está disponible en la página de GitHub del proyecto y en el sitio web llama.app.
Por qué importa
Los desarrolladores ahora pueden controlar la precisión de la GPU en llama.cpp, lo que podría mejorar el rendimiento o reducir el uso de memoria al ejecutar modelos LLaMA.