Oossa

Prime lance sa plateforme d’inférence pour modèles ouverts

Prime Inference, une nouvelle plateforme d’hébergement de modèles ouverts de pointe, est lancée avec GLM‑5.3 sur OpenRouter, avec une faible latence et une disponibilité de 100 %.

BrèveOossaPublié par Oossa: 1 min de lecture

Prime a annoncé le lancement public de Prime Inference, une plateforme qui exécute des modèles open source sur des grappes de GPU. Le service propose des capacités à la demande ou réservées et inclut un basculement automatique entre centres de données. Son premier point d’accès public, GLM‑5.3, a été mis à disposition sur OpenRouter le 22 septembre et n’a enregistré aucune erreur lors des appels d’outils, avec une disponibilité continue.

Prime Inference s’appuie sur des GPU NVIDIA Blackwell et une pile logicielle construite avec Dynamo, vLLM, Mooncake et FlashInfer. La plateforme propose une API compatible avec OpenAI, utilisable avec tout SDK existant.

Pourquoi c'est important

Les développeurs peuvent désormais déployer des modèles open source à l’échelle de la production avec une inférence fiable et à faible latence, sans avoir à construire leur propre infrastructure GPU.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.