# Prime lance sa plateforme d’inférence pour modèles ouverts

> Prime Inference, une nouvelle plateforme d’hébergement de modèles ouverts de pointe, est lancée avec GLM‑5.3 sur OpenRouter, avec une faible latence et une disponibilité de 100 %.

Oossa · 2026-10-02 · https://oossa.com/fr/prime-launches-inference-platform-for-open-source-models

Prime a annoncé le lancement public de Prime Inference, une plateforme qui exécute des modèles open source sur des grappes de GPU. Le service propose des capacités à la demande ou réservées et inclut un basculement automatique entre centres de données. Son premier point d’accès public, GLM‑5.3, a été mis à disposition sur OpenRouter le 22 septembre et n’a enregistré aucune erreur lors des appels d’outils, avec une disponibilité continue.

Prime Inference s’appuie sur des GPU NVIDIA Blackwell et une pile logicielle construite avec Dynamo, vLLM, Mooncake et FlashInfer. La plateforme propose une API compatible avec OpenAI, utilisable avec tout SDK existant.

## Les faits

- Prime Inference a été lancé publiquement le 22 septembre 2026 avec le modèle GLM‑5.3.
- Le service fonctionne sur des GPU NVIDIA Blackwell et affiche une disponibilité de 100 % depuis son lancement.

## Pourquoi c'est important

Les développeurs peuvent désormais déployer des modèles open source à l’échelle de la production avec une inférence fiable et à faible latence, sans avoir à construire leur propre infrastructure GPU.

## Sources et références

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

Dernière mise à jour: 2026-10-02
