El proyecto llama.cpp publicó la versión b11552 el 10-10-2026. El cambio impide que una solicitud actualice la caché del prompt de un espacio que ya está ocupado. Antes, el espacio ocupado se sobrescribía y la generación continuaba con un contexto incorrecto. Ahora se devuelve sin cambios y la nueva solicitud espera hasta que quede libre.
Por qué importa
Los desarrolladores que usan llama.cpp tendrán menos errores de generación cuando varias solicitudes compartan la memoria de la GPU.