Prime ने Prime Inference को सार्वजनिक रूप से लॉन्च करने की घोषणा की है। यह सर्विंग प्लेटफ़ॉर्म GPU क्लस्टर पर ओपन-सोर्स मॉडल चलाता है। सेवा सर्वरलेस और रिज़र्व्ड—दोनों तरह की क्षमता देती है और इसमें डेटा सेंटरों के बीच स्वचालित फ़ेलओवर शामिल है। इसका पहला सार्वजनिक एंडपॉइंट, GLM‑5.3, 22 सितंबर को OpenRouter पर उपलब्ध हुआ। तब से इसमें टूल-कॉल से जुड़ी कोई त्रुटि दर्ज नहीं हुई है और यह लगातार चालू रहा है।
Prime Inference में NVIDIA Blackwell GPU और Dynamo, vLLM, Mooncake तथा FlashInfer से बना सॉफ़्टवेयर स्टैक इस्तेमाल होता है। यह OpenAI-संगत API भी देता है, जिसे किसी भी मौजूदा SDK से कॉल किया जा सकता है।
यह क्यों मायने रखता है
डेवलपर अब अपना GPU इन्फ्रास्ट्रक्चर बनाए बिना, भरोसेमंद और कम लेटेंसी वाले इन्फरेंस के साथ ओपन-सोर्स मॉडल को बड़े पैमाने पर प्रोडक्शन में चला सकते हैं।