# Prime推出开源模型推理平台

> 面向前沿开源模型的服务平台 Prime Inference 正式上线，首个模型 GLM‑5.3 已登陆 OpenRouter，主打低延迟和 100% 正常运行时间。

Oossa · 2026-10-02 · https://oossa.com/zh/prime-launches-inference-platform-for-open-source-models

Prime宣布公开推出 Prime Inference。这是一个运行在 GPU 集群上的开源模型服务平台，支持无服务器和预留容量两种模式，并提供跨数据中心自动故障切换。首个公开端点 GLM‑5.3 于 September 22 在 OpenRouter 上线，至今没有出现工具调用错误，并持续正常运行。

Prime Inference 使用 NVIDIA Blackwell GPU，技术栈基于 Dynamo、vLLM、Mooncake 和 FlashInfer 构建，并提供兼容 OpenAI 的 API，可通过任何现有 SDK 调用。

## 事实

- Prime Inference 于 2026年9月22日公开上线，首发模型为 GLM‑5.3。
- 该服务运行在 NVIDIA Blackwell GPU 上，自上线以来正常运行时间为 100 %。

## 为什么重要

开发者现在无需自行搭建 GPU 基础设施，即可大规模部署开源模型，获得可靠、低延迟的推理服务。

## 来源与参考

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

最后更新: 2026-10-02
