Oossa

Prime lança plataforma de inferência para modelos abertos

Prime Inference, nova plataforma para servir modelos abertos de ponta, estreia com o GLM‑5.3 no OpenRouter, oferecendo baixa latência e 100% de disponibilidade.

NotaOossaPublicado pelo Oossa: 1 min de leitura

A Prime anunciou o lançamento público do Prime Inference, uma plataforma que executa modelos de código aberto em clusters de GPUs. O serviço oferece capacidade sob demanda e reservada, além de failover automático entre data centers. Seu primeiro endpoint público, o GLM‑5.3, foi disponibilizado no OpenRouter em 22 de setembro e, desde então, não registrou erros em chamadas de ferramentas e manteve disponibilidade contínua.

O Prime Inference usa GPUs NVIDIA Blackwell e uma infraestrutura desenvolvida com Dynamo, vLLM, Mooncake e FlashInfer. A plataforma oferece uma API compatível com a OpenAI, que pode ser acessada com qualquer SDK existente.

Por que importa

Agora, desenvolvedores podem executar modelos de código aberto em escala de produção, com inferência confiável e de baixa latência, sem precisar montar a própria infraestrutura de GPUs.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.