# Prime lanserar plattform för inferens med öppna modeller

> Prime Inference, en ny plattform för drift av öppna modeller i framkant, lanseras med GLM‑5.3 på OpenRouter och erbjuder låg latens och 100 % upptid.

Oossa · 2026-10-02 · https://oossa.com/sv/prime-launches-inference-platform-for-open-source-models

Prime har offentliggjort lanseringen av Prime Inference, en plattform som kör modeller med öppen källkod på GPU-kluster. Tjänsten stöder både serverlös kapacitet och reserverad kapacitet, och har automatisk överkoppling mellan datacenter. Den första publika ändpunkten, GLM‑5.3, blev tillgänglig på OpenRouter den 22 september och har hittills inte haft några fel vid verktygsanrop och haft kontinuerlig upptid.

Prime Inference använder NVIDIA Blackwell-GPU:er och en teknikstack byggd med Dynamo, vLLM, Mooncake och FlashInfer. Plattformen erbjuder ett OpenAI-kompatibelt API som kan anropas med valfritt befintligt SDK.

## Fakta

- Prime Inference lanserades offentligt den 22 september 2026 med modellen GLM‑5.3.
- Tjänsten körs på NVIDIA Blackwell-GPU:er och har haft 100 % upptid sedan lanseringen.

## Varför det spelar roll

Utvecklare kan nu driftsätta modeller med öppen källkod i produktionsskala med tillförlitlig inferens med låg latens, utan att behöva bygga en egen GPU-infrastruktur.

## Källor och referenser

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

Senast uppdaterad: 2026-10-02
