El equipo de ggml-org publicó llama.cpp versión b11510 el 8 de octubre de 2026. La versión incorpora un kernel PAD con bucles para CUDA, que permite a la biblioteca procesar tensores con más de 65.000 filas o secciones. También incluye binarios precompilados para Apple Silicon, macOS con Intel, iOS y varias versiones de Ubuntu (CPU, Vulkan y CUDA 12.8). El código y las declaraciones de procedencia están enlazados desde la página de GitHub.
Por qué importa
Los desarrolladores ahora pueden ejecutar modelos de lenguaje más grandes en GPU NVIDIA sin alcanzar el límite anterior de filas.