Prime宣布公开推出 Prime Inference。这是一个运行在 GPU 集群上的开源模型服务平台,支持无服务器和预留容量两种模式,并提供跨数据中心自动故障切换。首个公开端点 GLM‑5.3 于 September 22 在 OpenRouter 上线,至今没有出现工具调用错误,并持续正常运行。
Prime Inference 使用 NVIDIA Blackwell GPU,技术栈基于 Dynamo、vLLM、Mooncake 和 FlashInfer 构建,并提供兼容 OpenAI 的 API,可通过任何现有 SDK 调用。
为什么重要
开发者现在无需自行搭建 GPU 基础设施,即可大规模部署开源模型,获得可靠、低延迟的推理服务。