Prime anunció el lanzamiento público de Prime Inference, una plataforma que ejecuta modelos de código abierto en clústeres de GPU. El servicio admite capacidad tanto sin servidor como reservada e incluye conmutación automática por error entre centros de datos. Su primer endpoint público, GLM‑5.3, se habilitó en OpenRouter el 22 de septiembre y no ha registrado errores en llamadas a herramientas ni interrupciones del servicio.
Prime Inference utiliza GPU NVIDIA Blackwell y una pila tecnológica desarrollada con Dynamo, vLLM, Mooncake y FlashInfer. Además, ofrece una API compatible con OpenAI que puede usarse con cualquier SDK existente.
Por qué importa
Ahora, los desarrolladores pueden implementar modelos de código abierto a escala de producción con inferencia fiable y de baja latencia, sin tener que crear su propia infraestructura de GPU.