Prime از عرضه عمومی Prime Inference خبر داد؛ پلتفرمی برای اجرای مدلهای متنباز روی خوشههای GPU. این سرویس از ظرفیت بدونسرور و ظرفیت رزروشده پشتیبانی میکند و جابهجایی خودکار بین مراکز داده را هم دربرمیگیرد. نخستین نقطه پایانی عمومی آن، GLM‑5.3، در 22 سپتامبر در OpenRouter در دسترس قرار گرفت و تاکنون هیچ خطایی در فراخوانی ابزارها نداشته و بهطور پیوسته فعال بوده است.
Prime Inference از GPUهای NVIDIA Blackwell و مجموعهای مبتنی بر Dynamo، vLLM، Mooncake و FlashInfer استفاده میکند. همچنین یک API سازگار با OpenAI ارائه میدهد که با هر SDK موجود قابل فراخوانی است.
چرا مهم است
توسعهدهندگان حالا میتوانند مدلهای متنباز را در مقیاس تولید و با استنتاجی مطمئن و کمتأخیر به کار بگیرند، بیآنکه زیرساخت GPU خودشان را بسازند.