Prime은 GPU 클러스터에서 오픈소스 모델을 구동하는 서빙 플랫폼 Prime Inference를 정식 출시했다고 밝혔다. 이 서비스는 서버리스 용량과 예약 용량을 모두 지원하며, 데이터센터 간 자동 장애 조치 기능을 제공한다. 첫 공개 엔드포인트인 GLM‑5.3은 9월 22일 OpenRouter에서 제공되기 시작했으며, 지금까지 도구 호출 오류 없이 연속 가동됐다.
Prime Inference는 NVIDIA Blackwell GPU를 사용하며, Dynamo, vLLM, Mooncake, FlashInfer로 구성된 스택을 갖췄다. 기존 SDK로 호출할 수 있는 OpenAI 호환 API도 제공한다.
왜 중요한가
개발자는 이제 자체 GPU 인프라를 구축하지 않고도 오픈소스 모델을 프로덕션 규모로 배포하고, 안정적이고 지연 시간이 짧은 추론을 제공할 수 있다.