Prime har offentliggjort lanseringen av Prime Inference, en plattform som kör modeller med öppen källkod på GPU-kluster. Tjänsten stöder både serverlös kapacitet och reserverad kapacitet, och har automatisk överkoppling mellan datacenter. Den första publika ändpunkten, GLM‑5.3, blev tillgänglig på OpenRouter den 22 september och har hittills inte haft några fel vid verktygsanrop och haft kontinuerlig upptid.
Prime Inference använder NVIDIA Blackwell-GPU:er och en teknikstack byggd med Dynamo, vLLM, Mooncake och FlashInfer. Plattformen erbjuder ett OpenAI-kompatibelt API som kan anropas med valfritt befintligt SDK.
Varför det spelar roll
Utvecklare kan nu driftsätta modeller med öppen källkod i produktionsskala med tillförlitlig inferens med låg latens, utan att behöva bygga en egen GPU-infrastruktur.