Oossa

Prime запустила платформу для запуска открытых моделей

Prime Inference — новая платформа для запуска передовых открытых моделей — начала работу с моделью GLM‑5.3 на OpenRouter. Она обеспечивает низкую задержку и доступность 100%.

ЗаметкаOossaОпубликовано Oossa: 1 мин чтения

Prime объявила о публичном запуске Prime Inference — платформы для запуска моделей с открытым исходным кодом на GPU-кластерах. Сервис поддерживает как бессерверную работу, так и резервирование мощностей, а также автоматически переключается между дата-центрами при сбоях. Первая публичная модель, GLM‑5.3, стала доступна на OpenRouter 22 сентября; с момента запуска не зафиксировано ни одной ошибки при вызове инструментов, а сервис работает без перебоев.

Prime Inference использует GPU NVIDIA Blackwell и технологический стек на базе Dynamo, vLLM, Mooncake и FlashInfer. Платформа также предлагает совместимый с OpenAI API, к которому можно обращаться через любой существующий SDK.

Почему это важно

Теперь разработчики могут запускать модели с открытым исходным кодом в промышленном масштабе и получать стабильные ответы с низкой задержкой — без необходимости создавать собственную GPU-инфраструктуру.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.