Oossa

vLLM 0.31.0: cache dei pesi GPU per riavvii rapidi

La libreria open source per servire LLM vLLM 0.31.0 introduce un comando di precaricamento che mantiene i pesi post-quantizzati nella memoria GPU anche dopo il riavvio del motore.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il progetto vLLM ha rilasciato la versione 0.31.0 il 5 ottobre 2026. La novità principale è un comando di precaricamento che avvia un daemon per la cache dei pesi, consentendo ai pesi dei modelli post-quantizzati di restare nella memoria GPU quando il server si riavvia. La funzione è compatibile con il parallelismo dei dati e aggiunge un endpoint per il controllo dello stato. La release include inoltre 717 commit di 307 collaboratori.

Perché conta

Gli sviluppatori possono aggiornare o riavviare i servizi LLM senza ricaricare modelli di grandi dimensioni, riducendo i tempi di inattività delle applicazioni basate su vLLM.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.