# Prime lanza una plataforma de inferencia para modelos abiertos

> Prime Inference, una nueva plataforma para ofrecer modelos abiertos de última generación, ya está disponible con GLM‑5.3 en OpenRouter, con baja latencia y un tiempo de actividad del 100 %.

Oossa · 2026-10-02 · https://oossa.com/es/prime-launches-inference-platform-for-open-source-models

Prime anunció el lanzamiento público de Prime Inference, una plataforma que ejecuta modelos de código abierto en clústeres de GPU. El servicio admite capacidad tanto sin servidor como reservada e incluye conmutación automática por error entre centros de datos. Su primer endpoint público, GLM‑5.3, se habilitó en OpenRouter el 22 de septiembre y no ha registrado errores en llamadas a herramientas ni interrupciones del servicio.

Prime Inference utiliza GPU NVIDIA Blackwell y una pila tecnológica desarrollada con Dynamo, vLLM, Mooncake y FlashInfer. Además, ofrece una API compatible con OpenAI que puede usarse con cualquier SDK existente.

## Los hechos

- Prime Inference se lanzó públicamente el 22 de septiembre de 2026 con el modelo GLM‑5.3.
- El servicio funciona con GPU NVIDIA Blackwell y mantiene un tiempo de actividad del 100 % desde su lanzamiento.

## Por qué importa

Ahora, los desarrolladores pueden implementar modelos de código abierto a escala de producción con inferencia fiable y de baja latencia, sin tener que crear su propia infraestructura de GPU.

## Fuentes y referencias

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

Última actualización: 2026-10-02
