Oossa

Prime lanceert inferenceplatform voor open-sourcemodellen

Prime Inference, een nieuw platform voor het aanbieden van geavanceerde open modellen, is beschikbaar met GLM‑5.3 op OpenRouter en belooft lage latentie en 100% uptime.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Prime heeft Prime Inference publiek beschikbaar gemaakt, een platform dat open-sourcemodellen draait op GPU-clusters. De dienst biedt zowel serverless capaciteit als gereserveerde capaciteit en schakelt automatisch over naar andere datacenters bij storingen. Het eerste publieke endpoint, GLM‑5.3, kwam op 22 september beschikbaar op OpenRouter en heeft geen fouten bij toolaanroepen geregistreerd en is continu beschikbaar geweest.

Prime Inference maakt gebruik van NVIDIA Blackwell-GPU’s en een softwarestack met Dynamo, vLLM, Mooncake en FlashInfer. Het platform biedt een API die compatibel is met OpenAI en die met elke bestaande SDK kan worden aangeroepen.

Waarom het ertoe doet

Ontwikkelaars kunnen open-sourcemodellen nu op productieschaal inzetten met betrouwbare inference met lage latentie, zonder zelf GPU-infrastructuur te hoeven bouwen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.