A Prime anunciou o lançamento público do Prime Inference, uma plataforma que executa modelos de código aberto em clusters de GPUs. O serviço oferece capacidade sob demanda e reservada, além de failover automático entre data centers. Seu primeiro endpoint público, o GLM‑5.3, foi disponibilizado no OpenRouter em 22 de setembro e, desde então, não registrou erros em chamadas de ferramentas e manteve disponibilidade contínua.
O Prime Inference usa GPUs NVIDIA Blackwell e uma infraestrutura desenvolvida com Dynamo, vLLM, Mooncake e FlashInfer. A plataforma oferece uma API compatível com a OpenAI, que pode ser acessada com qualquer SDK existente.
Por que importa
Agora, desenvolvedores podem executar modelos de código aberto em escala de produção, com inferência confiável e de baixa latência, sem precisar montar a própria infraestrutura de GPUs.