Il progetto vLLM ha rilasciato la versione 0.31.0 il 5 ottobre 2026. La novità principale è un comando di precaricamento che avvia un daemon per la cache dei pesi, consentendo ai pesi dei modelli post-quantizzati di restare nella memoria GPU quando il server si riavvia. La funzione è compatibile con il parallelismo dei dati e aggiunge un endpoint per il controllo dello stato. La release include inoltre 717 commit di 307 collaboratori.
Perché conta
Gli sviluppatori possono aggiornare o riavviare i servizi LLM senza ricaricare modelli di grandi dimensioni, riducendo i tempi di inattività delle applicazioni basate su vLLM.