Oossa

Prime lanza una plataforma de inferencia para modelos abiertos

Prime Inference, una nueva plataforma para ofrecer modelos abiertos de última generación, ya está disponible con GLM‑5.3 en OpenRouter, con baja latencia y un tiempo de actividad del 100 %.

BreveOossaPublicado por Oossa: 1 min de lectura

Prime anunció el lanzamiento público de Prime Inference, una plataforma que ejecuta modelos de código abierto en clústeres de GPU. El servicio admite capacidad tanto sin servidor como reservada e incluye conmutación automática por error entre centros de datos. Su primer endpoint público, GLM‑5.3, se habilitó en OpenRouter el 22 de septiembre y no ha registrado errores en llamadas a herramientas ni interrupciones del servicio.

Prime Inference utiliza GPU NVIDIA Blackwell y una pila tecnológica desarrollada con Dynamo, vLLM, Mooncake y FlashInfer. Además, ofrece una API compatible con OpenAI que puede usarse con cualquier SDK existente.

Por qué importa

Ahora, los desarrolladores pueden implementar modelos de código abierto a escala de producción con inferencia fiable y de baja latencia, sin tener que crear su propia infraestructura de GPU.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.