vLLM-projektet släppte version 0.31.0 den 5 oktober 2026. Den största nyheten är ett nytt preload-kommando som startar en daemon för viktcache, så att efterkvantiserade modellvikter kan ligga kvar i GPU-minnet när servern startas om. Funktionen fungerar med dataparallellism och lägger till en endpoint för hälsokontroller. Versionen innehåller också 717 commits från 307 bidragsgivare.
Varför det spelar roll
Utvecklare kan uppdatera eller starta om LLM-tjänster utan att läsa in stora modeller på nytt, vilket minskar avbrottstiden för appar som bygger på vLLM.