# vLLM 0.31.0: cache dei pesi GPU per riavvii rapidi

> La libreria open source per servire LLM vLLM 0.31.0 introduce un comando di precaricamento che mantiene i pesi post-quantizzati nella memoria GPU anche dopo il riavvio del motore.

Oossa · 2026-10-05 · https://oossa.com/it/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

Il progetto vLLM ha rilasciato la versione 0.31.0 il 5 ottobre 2026. La novità principale è un comando di precaricamento che avvia un daemon per la cache dei pesi, consentendo ai pesi dei modelli post-quantizzati di restare nella memoria GPU quando il server si riavvia. La funzione è compatibile con il parallelismo dei dati e aggiunge un endpoint per il controllo dello stato. La release include inoltre 717 commit di 307 collaboratori.

## I fatti

- Versione 0.31.0 rilasciata il 2026-10-05
- 717 commit di 307 collaboratori

## Perché conta

Gli sviluppatori possono aggiornare o riavviare i servizi LLM senza ricaricare modelli di grandi dimensioni, riducendo i tempi di inattività delle applicazioni basate su vLLM.

## Fonti e riferimenti

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Ultimo aggiornamento: 2026-10-05
