Prime объявила о публичном запуске Prime Inference — платформы для запуска моделей с открытым исходным кодом на GPU-кластерах. Сервис поддерживает как бессерверную работу, так и резервирование мощностей, а также автоматически переключается между дата-центрами при сбоях. Первая публичная модель, GLM‑5.3, стала доступна на OpenRouter 22 сентября; с момента запуска не зафиксировано ни одной ошибки при вызове инструментов, а сервис работает без перебоев.
Prime Inference использует GPU NVIDIA Blackwell и технологический стек на базе Dynamo, vLLM, Mooncake и FlashInfer. Платформа также предлагает совместимый с OpenAI API, к которому можно обращаться через любой существующий SDK.
Почему это важно
Теперь разработчики могут запускать модели с открытым исходным кодом в промышленном масштабе и получать стабильные ответы с низкой задержкой — без необходимости создавать собственную GPU-инфраструктуру.