Primeは、GPUクラスター上でオープンソースモデルを稼働させる推論基盤「Prime Inference」の一般公開を発表した。サーバーレスと予約済みの処理能力に対応し、データセンター間の自動フェイルオーバーも備える。最初の一般公開エンドポイントとなるGLM‑5.3は9月22日にOpenRouterで利用可能となり、ツール呼び出しエラーゼロと連続稼働を記録している。
Prime InferenceはNVIDIA Blackwell GPUを採用し、Dynamo、vLLM、Mooncake、FlashInferで構成されたスタックを使用する。また、既存のあらゆるSDKから呼び出せる、OpenAI互換のAPIを提供する。
なぜ重要か
開発者は、自前でGPUインフラを構築しなくても、オープンソースモデルを本番規模で展開し、信頼性の高い低レイテンシーの推論を利用できる。