أعلنت Prime الإطلاق العام لمنصة Prime Inference، وهي منصة لتشغيل نماذج مفتوحة المصدر على مجموعات من وحدات معالجة الرسوميات. وتدعم الخدمة السعة عند الطلب والسعة المحجوزة، وتشمل التحويل التلقائي إلى مراكز بيانات أخرى عند تعطل أحدها. وأُتيح أول منفذ عام لها، GLM‑5.3، على OpenRouter في 22 سبتمبر، ولم يسجل أي أخطاء في استدعاء الأدوات، مع توافر متواصل.
تستخدم Prime Inference وحدات NVIDIA Blackwell GPU، ومجموعة تقنيات مبنية باستخدام Dynamo وvLLM وMooncake وFlashInfer، كما توفر واجهة API متوافقة مع OpenAI يمكن استدعاؤها باستخدام أي حزمة SDK موجودة.
لماذا يهم
بات بإمكان المطورين تشغيل نماذج مفتوحة المصدر على نطاق الإنتاج باستدلال موثوق ومنخفض زمن الاستجابة، من دون الحاجة إلى إنشاء بنية تحتية خاصة بوحدات GPU.