El equipo de ggml-org publicó la versión b11499 de llama.cpp el 8 de octubre de 2026. La actualización modifica el backend de CUDA para que la operación roll use desplazamientos en bytes, lo que permite a la GPU procesar correctamente datos no contiguos. La versión también incluye nuevos binarios para Apple Silicon, macOS con procesadores Intel, iOS y varias compilaciones de Ubuntu (CPU, Vulkan y CUDA 12). Todos los archivos se pueden descargar desde la página de lanzamientos de GitHub.
Por qué importa
Los desarrolladores pueden ejecutar llama.cpp en más configuraciones de GPU sin errores, lo que amplía el uso local de LLM en equipos de escritorio y servidores.