# Prime startet Inferenzplattform für Open-Source-Modelle

> Prime Inference, eine neue Plattform für den Betrieb führender offener Modelle, geht mit GLM‑5.3 auf OpenRouter an den Start – mit niedriger Latenz und 100 % Verfügbarkeit.

Oossa · 2026-10-02 · https://oossa.com/de/prime-launches-inference-platform-for-open-source-models

Prime hat Prime Inference öffentlich gestartet. Die Plattform betreibt Open-Source-Modelle auf GPU-Clustern. Der Dienst unterstützt sowohl serverlose als auch reservierte Kapazitäten und bietet automatisches Failover zwischen Rechenzentren. Der erste öffentliche Endpunkt, GLM‑5.3, ist seit dem 22. September auf OpenRouter verfügbar und verzeichnet bislang keine Fehler bei Tool-Aufrufen sowie durchgängige Verfügbarkeit.

Prime Inference nutzt NVIDIA-Blackwell-GPUs und einen Stack auf Basis von Dynamo, vLLM, Mooncake und FlashInfer. Die Plattform bietet außerdem eine mit OpenAI kompatible API, die sich mit jedem bestehenden SDK aufrufen lässt.

## Die Fakten

- Prime Inference wurde am 22. September 2026 mit dem Modell GLM‑5.3 öffentlich gestartet.
- Der Dienst läuft auf NVIDIA-Blackwell-GPUs und verzeichnet seit dem Start eine Verfügbarkeit von 100 %. 

## Warum es wichtig ist

Entwickler können Open-Source-Modelle jetzt zuverlässig und mit niedriger Latenz im Produktionsmaßstab einsetzen, ohne eine eigene GPU-Infrastruktur aufbauen zu müssen.

## Quellen und Referenzen

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

Zuletzt aktualisiert: 2026-10-02
