El proyecto ggml‑org/llama.cpp publicó la versión b11530 el 2026-10-09. El cambio mantiene estático el grafo de muestreo del backend entre ubatches, de modo que su estructura ya no cambia durante las etapas de reserva y decodificación. Esto corrige los cierres inesperados que se producían cuando la topología del grafo cambiaba después de una compilación de reserva. La corrección se aplica a todas las compilaciones indicadas —macOS, Linux, Android, Windows y openEuler— y a todos los backends de hardware, como CUDA, Vulkan y OpenCL.
Por qué importa
Los desarrolladores que usan llama.cpp tendrán menos errores en tiempo de ejecución al generar varias salidas en cualquier CPU o GPU compatible.