# vLLM 0.31.0 incorpora una caché de pesos para reinicios rápidos

> La biblioteca de código abierto vLLM 0.31.0 añade un comando de precarga que mantiene en la memoria de la GPU los pesos poscuantizados durante los reinicios del motor.

Oossa · 2026-10-05 · https://oossa.com/es/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

El proyecto vLLM publicó la versión 0.31.0 el 5 de octubre de 2026. La novedad principal es un comando de precarga que inicia un proceso en segundo plano para gestionar la caché de pesos y permite mantener en la memoria de la GPU los pesos de modelos poscuantizados cuando se reinicia el servidor. La función es compatible con el paralelismo de datos e incorpora un endpoint de comprobación del estado. La versión también reúne 717 commits de 307 colaboradores.

## Los hechos

- La versión 0.31.0 se publicó el 2026-10-05
- 717 commits de 307 colaboradores

## Por qué importa

Los desarrolladores pueden actualizar o reiniciar servicios de LLM sin volver a cargar modelos grandes, lo que reduce el tiempo de inactividad de las aplicaciones que dependen de vLLM.

## Fuentes y referencias

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Última actualización: 2026-10-05
