Prime hat Prime Inference öffentlich gestartet. Die Plattform betreibt Open-Source-Modelle auf GPU-Clustern. Der Dienst unterstützt sowohl serverlose als auch reservierte Kapazitäten und bietet automatisches Failover zwischen Rechenzentren. Der erste öffentliche Endpunkt, GLM‑5.3, ist seit dem 22. September auf OpenRouter verfügbar und verzeichnet bislang keine Fehler bei Tool-Aufrufen sowie durchgängige Verfügbarkeit.
Prime Inference nutzt NVIDIA-Blackwell-GPUs und einen Stack auf Basis von Dynamo, vLLM, Mooncake und FlashInfer. Die Plattform bietet außerdem eine mit OpenAI kompatible API, die sich mit jedem bestehenden SDK aufrufen lässt.
Warum es wichtig ist
Entwickler können Open-Source-Modelle jetzt zuverlässig und mit niedriger Latenz im Produktionsmaßstab einsetzen, ohne eine eigene GPU-Infrastruktur aufbauen zu müssen.