# Prime lanceert inferenceplatform voor open-sourcemodellen

> Prime Inference, een nieuw platform voor het aanbieden van geavanceerde open modellen, is beschikbaar met GLM‑5.3 op OpenRouter en belooft lage latentie en 100% uptime.

Oossa · 2026-10-02 · https://oossa.com/nl/prime-launches-inference-platform-for-open-source-models

Prime heeft Prime Inference publiek beschikbaar gemaakt, een platform dat open-sourcemodellen draait op GPU-clusters. De dienst biedt zowel serverless capaciteit als gereserveerde capaciteit en schakelt automatisch over naar andere datacenters bij storingen. Het eerste publieke endpoint, GLM‑5.3, kwam op 22 september beschikbaar op OpenRouter en heeft geen fouten bij toolaanroepen geregistreerd en is continu beschikbaar geweest.

Prime Inference maakt gebruik van NVIDIA Blackwell-GPU’s en een softwarestack met Dynamo, vLLM, Mooncake en FlashInfer. Het platform biedt een API die compatibel is met OpenAI en die met elke bestaande SDK kan worden aangeroepen.

## De feiten

- Prime Inference werd op 22 september 2026 publiek gelanceerd met het GLM‑5.3-model.
- De dienst draait op NVIDIA Blackwell-GPU’s en heeft sinds de lancering 100% uptime geboden.

## Waarom het ertoe doet

Ontwikkelaars kunnen open-sourcemodellen nu op productieschaal inzetten met betrouwbare inference met lage latentie, zonder zelf GPU-infrastructuur te hoeven bouwen.

## Bronnen en referenties

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

Laatst bijgewerkt: 2026-10-02
