El equipo de ggml-org publicó llama.cpp versión b11498 el 2026‑10‑08. La actualización corrige un problema de un kernel de CUDA que se producía cuando ciertas dimensiones de los tensores superaban los límites de la cuadrícula de la GPU. También incluye nuevos binarios precompilados para Apple Silicon, macOS con Intel, iOS y varias configuraciones de Ubuntu, incluidas las versiones para CPU, Vulkan y CUDA 12.8.
Por qué importa
Los desarrolladores ahora pueden ejecutar llama.cpp en más configuraciones de GPU sin que se produzcan fallos y disponer de binarios listos para usar en su plataforma.