Oossa

Prime پلتفرم استنتاج مدل‌های متن‌باز را عرضه کرد

Prime Inference، پلتفرم جدید میزبانی مدل‌های متن‌باز پیشرفته، با GLM‑5.3 در OpenRouter راه‌اندازی شد و تأخیر کم و آپ‌تایم ۱۰۰درصدی ارائه می‌دهد.

خبر کوتاهOossaمنتشرشده توسط Oossa: 1 دقیقه مطالعه

Prime از عرضه عمومی Prime Inference خبر داد؛ پلتفرمی برای اجرای مدل‌های متن‌باز روی خوشه‌های GPU. این سرویس از ظرفیت بدون‌سرور و ظرفیت رزروشده پشتیبانی می‌کند و جابه‌جایی خودکار بین مراکز داده را هم دربرمی‌گیرد. نخستین نقطه پایانی عمومی آن، GLM‑5.3، در 22 سپتامبر در OpenRouter در دسترس قرار گرفت و تاکنون هیچ خطایی در فراخوانی ابزارها نداشته و به‌طور پیوسته فعال بوده است.

Prime Inference از GPUهای NVIDIA Blackwell و مجموعه‌ای مبتنی بر Dynamo، vLLM، Mooncake و FlashInfer استفاده می‌کند. همچنین یک API سازگار با OpenAI ارائه می‌دهد که با هر SDK موجود قابل فراخوانی است.

چرا مهم است

توسعه‌دهندگان حالا می‌توانند مدل‌های متن‌باز را در مقیاس تولید و با استنتاجی مطمئن و کم‌تأخیر به کار بگیرند، بی‌آنکه زیرساخت GPU خودشان را بسازند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.