Oossa

vLLM 0.31.0 får snabb omstart med viktcache

LLM-serverbiblioteket vLLM 0.31.0 med öppen källkod introducerar ett preload-kommando som håller efterkvantiserade vikter kvar i GPU-minnet när motorn startas om.

NotisAv Publicerad av Oossa: 1 min läsning

vLLM-projektet släppte version 0.31.0 den 5 oktober 2026. Den största nyheten är ett nytt preload-kommando som startar en daemon för viktcache, så att efterkvantiserade modellvikter kan ligga kvar i GPU-minnet när servern startas om. Funktionen fungerar med dataparallellism och lägger till en endpoint för hälsokontroller. Versionen innehåller också 717 commits från 307 bidragsgivare.

Varför det spelar roll

Utvecklare kan uppdatera eller starta om LLM-tjänster utan att läsa in stora modeller på nytt, vilket minskar avbrottstiden för appar som bygger på vLLM.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.