Het vLLM-project bracht versie 0.31.0 uit op 5 oktober 2026. De belangrijkste vernieuwing is een nieuwe preload-opdracht die een daemon voor de gewichtencache start. Daardoor blijven de post-gekwantiseerde modelgewichten in het GPU-geheugen staan wanneer de server opnieuw wordt gestart. De functie werkt met dataparallelisme en voegt een endpoint voor statuscontroles toe. De release bevat ook 717 commits van 307 bijdragers.
Waarom het ertoe doet
Ontwikkelaars kunnen LLM-diensten bijwerken of opnieuw starten zonder grote modellen opnieuw te laden. Dat beperkt de downtime voor toepassingen die op vLLM draaien.