# Prime、オープンモデル向け推論プラットフォームを公開

> 最先端のオープンモデルを提供する新サービスPrime Inferenceが、GLM‑5.3とともにOpenRouterで稼働を開始。低レイテンシーと稼働率100%をうたう。

Oossa · 2026-10-02 · https://oossa.com/ja/prime-launches-inference-platform-for-open-source-models

Primeは、GPUクラスター上でオープンソースモデルを稼働させる推論基盤「Prime Inference」の一般公開を発表した。サーバーレスと予約済みの処理能力に対応し、データセンター間の自動フェイルオーバーも備える。最初の一般公開エンドポイントとなるGLM‑5.3は9月22日にOpenRouterで利用可能となり、ツール呼び出しエラーゼロと連続稼働を記録している。

Prime InferenceはNVIDIA Blackwell GPUを採用し、Dynamo、vLLM、Mooncake、FlashInferで構成されたスタックを使用する。また、既存のあらゆるSDKから呼び出せる、OpenAI互換のAPIを提供する。

## 事実

- Prime Inferenceは2026年9月22日、GLM‑5.3とともに一般公開された。
- このサービスはNVIDIA Blackwell GPU上で稼働し、公開以来、稼働率100%を維持している。

## なぜ重要か

開発者は、自前でGPUインフラを構築しなくても、オープンソースモデルを本番規模で展開し、信頼性の高い低レイテンシーの推論を利用できる。

## 出典と参考資料

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

最終更新: 2026-10-02
