Oossa

Prime、オープンモデル向け推論プラットフォームを公開

最先端のオープンモデルを提供する新サービスPrime Inferenceが、GLM‑5.3とともにOpenRouterで稼働を開始。低レイテンシーと稼働率100%をうたう。

短信OossaOossa公開日: 1 分で読める

Primeは、GPUクラスター上でオープンソースモデルを稼働させる推論基盤「Prime Inference」の一般公開を発表した。サーバーレスと予約済みの処理能力に対応し、データセンター間の自動フェイルオーバーも備える。最初の一般公開エンドポイントとなるGLM‑5.3は9月22日にOpenRouterで利用可能となり、ツール呼び出しエラーゼロと連続稼働を記録している。

Prime InferenceはNVIDIA Blackwell GPUを採用し、Dynamo、vLLM、Mooncake、FlashInferで構成されたスタックを使用する。また、既存のあらゆるSDKから呼び出せる、OpenAI互換のAPIを提供する。

なぜ重要か

開発者は、自前でGPUインフラを構築しなくても、オープンソースモデルを本番規模で展開し、信頼性の高い低レイテンシーの推論を利用できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。