El equipo de ggml‑org lanzó llama.cpp versión b11391 el 4 de octubre de 2026. La actualización traslada una variable de CUDA llamada blocks_per_col al lugar donde se utiliza. El cambio fue aprobado por Adrien Gallouët. El lanzamiento también incluye nuevos binarios precompilados para macOS con Apple Silicon, macOS con Intel, iOS y varias versiones de Ubuntu (CPU, Vulkan y CUDA 12). Todos los archivos están disponibles para descargar desde la página del lanzamiento en GitHub.
Por qué importa
Los desarrolladores ahora pueden ejecutar llama.cpp en más tipos de hardware sin tener que compilarlo, especialmente quienes usan GPU compatibles con CUDA.