Oossa

Prime, 오픈소스 모델 추론 플랫폼 출시

최첨단 오픈 모델을 제공하는 새 플랫폼 Prime Inference가 GLM‑5.3을 탑재해 OpenRouter에서 서비스를 시작했다. 낮은 지연 시간과 100% 가동률을 내세운다.

짧은 소식OossaOossa 게시일: 1 분 읽기

Prime은 GPU 클러스터에서 오픈소스 모델을 구동하는 서빙 플랫폼 Prime Inference를 정식 출시했다고 밝혔다. 이 서비스는 서버리스 용량과 예약 용량을 모두 지원하며, 데이터센터 간 자동 장애 조치 기능을 제공한다. 첫 공개 엔드포인트인 GLM‑5.3은 9월 22일 OpenRouter에서 제공되기 시작했으며, 지금까지 도구 호출 오류 없이 연속 가동됐다.

Prime Inference는 NVIDIA Blackwell GPU를 사용하며, Dynamo, vLLM, Mooncake, FlashInfer로 구성된 스택을 갖췄다. 기존 SDK로 호출할 수 있는 OpenAI 호환 API도 제공한다.

왜 중요한가

개발자는 이제 자체 GPU 인프라를 구축하지 않고도 오픈소스 모델을 프로덕션 규모로 배포하고, 안정적이고 지연 시간이 짧은 추론을 제공할 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.