# Prime lança plataforma de inferência para modelos abertos

> Prime Inference, nova plataforma para servir modelos abertos de ponta, estreia com o GLM‑5.3 no OpenRouter, oferecendo baixa latência e 100% de disponibilidade.

Oossa · 2026-10-02 · https://oossa.com/pt/prime-launches-inference-platform-for-open-source-models

A Prime anunciou o lançamento público do Prime Inference, uma plataforma que executa modelos de código aberto em clusters de GPUs. O serviço oferece capacidade sob demanda e reservada, além de failover automático entre data centers. Seu primeiro endpoint público, o GLM‑5.3, foi disponibilizado no OpenRouter em 22 de setembro e, desde então, não registrou erros em chamadas de ferramentas e manteve disponibilidade contínua.

O Prime Inference usa GPUs NVIDIA Blackwell e uma infraestrutura desenvolvida com Dynamo, vLLM, Mooncake e FlashInfer. A plataforma oferece uma API compatível com a OpenAI, que pode ser acessada com qualquer SDK existente.

## Os fatos

- O Prime Inference foi lançado publicamente em 22 de setembro de 2026 com o modelo GLM‑5.3.
- O serviço funciona com GPUs NVIDIA Blackwell e mantém 100% de disponibilidade desde o lançamento.

## Por que importa

Agora, desenvolvedores podem executar modelos de código aberto em escala de produção, com inferência confiável e de baixa latência, sem precisar montar a própria infraestrutura de GPUs.

## Fontes e referências

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

Última atualização: 2026-10-02
