El equipo de ggml-org publicó la versión b11534 de llama.cpp el 2026-10-09. La actualización integra las copias de instantáneas de estado en la caché recurrente y elimina copias adicionales en CUDA cuando K = 1, un caso de decodificación sin especulación. El cambio se limita al backend de CUDA, por lo que las compilaciones para CPU y Vulkan no cambian. Hay binarios precompilados disponibles para descargar para macOS, iOS y varias versiones de Ubuntu.
Quienes usen la versión con CUDA deberían notar una ligera reducción del tráfico de memoria de la GPU, lo que puede mejorar la velocidad en el hardware compatible.
Por qué importa
Quienes usan CUDA podrían obtener inferencias más rápidas porque la biblioteca ahora mueve menos datos en la GPU.