El proyecto vLLM publicó la versión 0.31.0 el 5 de octubre de 2026. La novedad principal es un comando de precarga que inicia un proceso en segundo plano para gestionar la caché de pesos y permite mantener en la memoria de la GPU los pesos de modelos poscuantizados cuando se reinicia el servidor. La función es compatible con el paralelismo de datos e incorpora un endpoint de comprobación del estado. La versión también reúne 717 commits de 307 colaboradores.
Por qué importa
Los desarrolladores pueden actualizar o reiniciar servicios de LLM sin volver a cargar modelos grandes, lo que reduce el tiempo de inactividad de las aplicaciones que dependen de vLLM.