Oossa

vLLM 0.31.0 incorpora una caché de pesos para reinicios rápidos

La biblioteca de código abierto vLLM 0.31.0 añade un comando de precarga que mantiene en la memoria de la GPU los pesos poscuantizados durante los reinicios del motor.

BrevePor Publicado por Oossa: 1 min de lectura

El proyecto vLLM publicó la versión 0.31.0 el 5 de octubre de 2026. La novedad principal es un comando de precarga que inicia un proceso en segundo plano para gestionar la caché de pesos y permite mantener en la memoria de la GPU los pesos de modelos poscuantizados cuando se reinicia el servidor. La función es compatible con el paralelismo de datos e incorpora un endpoint de comprobación del estado. La versión también reúne 717 commits de 307 colaboradores.

Por qué importa

Los desarrolladores pueden actualizar o reiniciar servicios de LLM sin volver a cargar modelos grandes, lo que reduce el tiempo de inactividad de las aplicaciones que dependen de vLLM.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.