Oossa

vLLM 0.31.0 voegt snelle herstart met gewichtencache toe

De opensourcebibliotheek voor het draaien van LLM’s, vLLM 0.31.0, introduceert een preload-opdracht die post-gekwantiseerde gewichten in het GPU-geheugen houdt wanneer de engine opnieuw wordt gestart.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het vLLM-project bracht versie 0.31.0 uit op 5 oktober 2026. De belangrijkste vernieuwing is een nieuwe preload-opdracht die een daemon voor de gewichtencache start. Daardoor blijven de post-gekwantiseerde modelgewichten in het GPU-geheugen staan wanneer de server opnieuw wordt gestart. De functie werkt met dataparallelisme en voegt een endpoint voor statuscontroles toe. De release bevat ook 717 commits van 307 bijdragers.

Waarom het ertoe doet

Ontwikkelaars kunnen LLM-diensten bijwerken of opnieuw starten zonder grote modellen opnieuw te laden. Dat beperkt de downtime voor toepassingen die op vLLM draaien.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.