Prime a annoncé le lancement public de Prime Inference, une plateforme qui exécute des modèles open source sur des grappes de GPU. Le service propose des capacités à la demande ou réservées et inclut un basculement automatique entre centres de données. Son premier point d’accès public, GLM‑5.3, a été mis à disposition sur OpenRouter le 22 septembre et n’a enregistré aucune erreur lors des appels d’outils, avec une disponibilité continue.
Prime Inference s’appuie sur des GPU NVIDIA Blackwell et une pile logicielle construite avec Dynamo, vLLM, Mooncake et FlashInfer. La plateforme propose une API compatible avec OpenAI, utilisable avec tout SDK existant.
Pourquoi c'est important
Les développeurs peuvent désormais déployer des modèles open source à l’échelle de la production avec une inférence fiable et à faible latence, sans avoir à construire leur propre infrastructure GPU.