# vLLM 0.31.0 में GPU सर्विंग के लिए तेज़ रीस्टार्ट वेट कैश

> ओपन-सोर्स LLM सर्विंग लाइब्रेरी vLLM 0.31.0 में एक प्रीलोड CLI जोड़ा गया है, जो इंजन रीस्टार्ट होने पर भी पोस्ट-क्वांटाइज़्ड वेट को GPU मेमोरी में बनाए रखता है।

Oossa · 2026-10-05 · https://oossa.com/hi/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

vLLM प्रोजेक्ट ने 5 अक्टूबर, 2026 को संस्करण 0.31.0 जारी किया। इसकी खासियत नया प्रीलोड कमांड है, जो वेट-कैश डेमन शुरू करता है। इससे सर्वर रीस्टार्ट होने पर भी पोस्ट-क्वांटाइज़्ड मॉडल वेट GPU मेमोरी में बने रहते हैं। यह सुविधा डेटा पैरेललिज़्म के साथ काम करती है और इसमें हेल्थ-चेक एंडपॉइंट भी शामिल है। इस रिलीज़ में 307 योगदानकर्ताओं के 717 कमिट भी शामिल हैं।

## तथ्य

- संस्करण 0.31.0, 2026‑10‑05 को जारी हुआ
- 307 योगदानकर्ताओं के 717 कमिट

## यह क्यों मायने रखता है

डेवलपर बड़े मॉडल दोबारा लोड किए बिना LLM सेवाओं को अपडेट या रीस्टार्ट कर सकते हैं। इससे vLLM पर निर्भर ऐप्लिकेशनों का डाउनटाइम घट सकता है।

## स्रोत और संदर्भ

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

अंतिम अपडेट: 2026-10-05
