Oossa

Prime lanserar plattform för inferens med öppna modeller

Prime Inference, en ny plattform för drift av öppna modeller i framkant, lanseras med GLM‑5.3 på OpenRouter och erbjuder låg latens och 100 % upptid.

NotisOossaPublicerad av Oossa: 1 min läsning

Prime har offentliggjort lanseringen av Prime Inference, en plattform som kör modeller med öppen källkod på GPU-kluster. Tjänsten stöder både serverlös kapacitet och reserverad kapacitet, och har automatisk överkoppling mellan datacenter. Den första publika ändpunkten, GLM‑5.3, blev tillgänglig på OpenRouter den 22 september och har hittills inte haft några fel vid verktygsanrop och haft kontinuerlig upptid.

Prime Inference använder NVIDIA Blackwell-GPU:er och en teknikstack byggd med Dynamo, vLLM, Mooncake och FlashInfer. Plattformen erbjuder ett OpenAI-kompatibelt API som kan anropas med valfritt befintligt SDK.

Varför det spelar roll

Utvecklare kan nu driftsätta modeller med öppen källkod i produktionsskala med tillförlitlig inferens med låg latens, utan att behöva bygga en egen GPU-infrastruktur.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.