Prime, açık kaynaklı modelleri GPU kümelerinde çalıştıran servis platformu Prime Inference’ı herkese açtığını duyurdu. Hizmet, sunucusuz ve ayrılmış kapasite seçeneklerini destekliyor ve veri merkezleri arasında otomatik yük devri içeriyor. İlk herkese açık uç noktası GLM‑5.3, 22 Eylül’de OpenRouter’da kullanıma sunuldu; o tarihten bu yana araç çağrısı hatası yaşanmadı ve hizmet kesintisiz çalıştı.
Prime Inference, NVIDIA Blackwell GPU’larını; Dynamo, vLLM, Mooncake ve FlashInfer ile oluşturulmuş bir teknoloji yığınını kullanıyor. Ayrıca mevcut tüm SDK’larla kullanılabilen, OpenAI uyumlu bir API sunuyor.
Neden önemli
Geliştiriciler artık kendi GPU altyapılarını kurmadan, açık kaynaklı modelleri üretim ölçeğinde güvenilir ve düşük gecikmeli çıkarımla çalıştırabilir.