Oossa

Prime推出开源模型推理平台

面向前沿开源模型的服务平台 Prime Inference 正式上线,首个模型 GLM‑5.3 已登陆 OpenRouter,主打低延迟和 100% 正常运行时间。

简讯OossaOossa 发布日期: 1 分钟阅读

Prime宣布公开推出 Prime Inference。这是一个运行在 GPU 集群上的开源模型服务平台,支持无服务器和预留容量两种模式,并提供跨数据中心自动故障切换。首个公开端点 GLM‑5.3 于 September 22 在 OpenRouter 上线,至今没有出现工具调用错误,并持续正常运行。

Prime Inference 使用 NVIDIA Blackwell GPU,技术栈基于 Dynamo、vLLM、Mooncake 和 FlashInfer 构建,并提供兼容 OpenAI 的 API,可通过任何现有 SDK 调用。

为什么重要

开发者现在无需自行搭建 GPU 基础设施,即可大规模部署开源模型,获得可靠、低延迟的推理服务。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。