# vLLM 0.31.0 får snabb omstart med viktcache

> LLM-serverbiblioteket vLLM 0.31.0 med öppen källkod introducerar ett preload-kommando som håller efterkvantiserade vikter kvar i GPU-minnet när motorn startas om.

Oossa · 2026-10-05 · https://oossa.com/sv/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

vLLM-projektet släppte version 0.31.0 den 5 oktober 2026. Den största nyheten är ett nytt preload-kommando som startar en daemon för viktcache, så att efterkvantiserade modellvikter kan ligga kvar i GPU-minnet när servern startas om. Funktionen fungerar med dataparallellism och lägger till en endpoint för hälsokontroller. Versionen innehåller också 717 commits från 307 bidragsgivare.

## Fakta

- Version 0.31.0 släpptes 2026-10-05
- 717 commits från 307 bidragsgivare

## Varför det spelar roll

Utvecklare kan uppdatera eller starta om LLM-tjänster utan att läsa in stora modeller på nytt, vilket minskar avbrottstiden för appar som bygger på vLLM.

## Källor och referenser

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Senast uppdaterad: 2026-10-05
