Oossa

vLLM 0.31.0 में GPU सर्विंग के लिए तेज़ रीस्टार्ट वेट कैश

ओपन-सोर्स LLM सर्विंग लाइब्रेरी vLLM 0.31.0 में एक प्रीलोड CLI जोड़ा गया है, जो इंजन रीस्टार्ट होने पर भी पोस्ट-क्वांटाइज़्ड वेट को GPU मेमोरी में बनाए रखता है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

vLLM प्रोजेक्ट ने 5 अक्टूबर, 2026 को संस्करण 0.31.0 जारी किया। इसकी खासियत नया प्रीलोड कमांड है, जो वेट-कैश डेमन शुरू करता है। इससे सर्वर रीस्टार्ट होने पर भी पोस्ट-क्वांटाइज़्ड मॉडल वेट GPU मेमोरी में बने रहते हैं। यह सुविधा डेटा पैरेललिज़्म के साथ काम करती है और इसमें हेल्थ-चेक एंडपॉइंट भी शामिल है। इस रिलीज़ में 307 योगदानकर्ताओं के 717 कमिट भी शामिल हैं।

यह क्यों मायने रखता है

डेवलपर बड़े मॉडल दोबारा लोड किए बिना LLM सेवाओं को अपडेट या रीस्टार्ट कर सकते हैं। इससे vLLM पर निर्भर ऐप्लिकेशनों का डाउनटाइम घट सकता है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।