Prime heeft Prime Inference publiek beschikbaar gemaakt, een platform dat open-sourcemodellen draait op GPU-clusters. De dienst biedt zowel serverless capaciteit als gereserveerde capaciteit en schakelt automatisch over naar andere datacenters bij storingen. Het eerste publieke endpoint, GLM‑5.3, kwam op 22 september beschikbaar op OpenRouter en heeft geen fouten bij toolaanroepen geregistreerd en is continu beschikbaar geweest.
Prime Inference maakt gebruik van NVIDIA Blackwell-GPU’s en een softwarestack met Dynamo, vLLM, Mooncake en FlashInfer. Het platform biedt een API die compatibel is met OpenAI en die met elke bestaande SDK kan worden aangeroepen.
Waarom het ertoe doet
Ontwikkelaars kunnen open-sourcemodellen nu op productieschaal inzetten met betrouwbare inference met lage latentie, zonder zelf GPU-infrastructuur te hoeven bouwen.