# vLLM 0.31.0 voegt snelle herstart met gewichtencache toe

> De opensourcebibliotheek voor het draaien van LLM’s, vLLM 0.31.0, introduceert een preload-opdracht die post-gekwantiseerde gewichten in het GPU-geheugen houdt wanneer de engine opnieuw wordt gestart.

Oossa · 2026-10-05 · https://oossa.com/nl/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

Het vLLM-project bracht versie 0.31.0 uit op 5 oktober 2026. De belangrijkste vernieuwing is een nieuwe preload-opdracht die een daemon voor de gewichtencache start. Daardoor blijven de post-gekwantiseerde modelgewichten in het GPU-geheugen staan wanneer de server opnieuw wordt gestart. De functie werkt met dataparallelisme en voegt een endpoint voor statuscontroles toe. De release bevat ook 717 commits van 307 bijdragers.

## De feiten

- Versie 0.31.0 uitgebracht op 2026-10-05
- 717 commits van 307 bijdragers

## Waarom het ertoe doet

Ontwikkelaars kunnen LLM-diensten bijwerken of opnieuw starten zonder grote modellen opnieuw te laden. Dat beperkt de downtime voor toepassingen die op vLLM draaien.

## Bronnen en referenties

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Laatst bijgewerkt: 2026-10-05
