Oossa

Prime startet Inferenzplattform für Open-Source-Modelle

Prime Inference, eine neue Plattform für den Betrieb führender offener Modelle, geht mit GLM‑5.3 auf OpenRouter an den Start – mit niedriger Latenz und 100 % Verfügbarkeit.

KurzmeldungOossaVon Oossa veröffentlicht: 1 Min. Lesezeit

Prime hat Prime Inference öffentlich gestartet. Die Plattform betreibt Open-Source-Modelle auf GPU-Clustern. Der Dienst unterstützt sowohl serverlose als auch reservierte Kapazitäten und bietet automatisches Failover zwischen Rechenzentren. Der erste öffentliche Endpunkt, GLM‑5.3, ist seit dem 22. September auf OpenRouter verfügbar und verzeichnet bislang keine Fehler bei Tool-Aufrufen sowie durchgängige Verfügbarkeit.

Prime Inference nutzt NVIDIA-Blackwell-GPUs und einen Stack auf Basis von Dynamo, vLLM, Mooncake und FlashInfer. Die Plattform bietet außerdem eine mit OpenAI kompatible API, die sich mit jedem bestehenden SDK aufrufen lässt.

Warum es wichtig ist

Entwickler können Open-Source-Modelle jetzt zuverlässig und mit niedriger Latenz im Produktionsmaßstab einsetzen, ohne eine eigene GPU-Infrastruktur aufbauen zu müssen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.