# Prime lancia una piattaforma di inferenza per modelli open source

> Prime Inference, una nuova piattaforma di serving per modelli open di frontiera, debutta con GLM‑5.3 su OpenRouter, con bassa latenza e uptime del 100%.

Oossa · 2026-10-02 · https://oossa.com/it/prime-launches-inference-platform-for-open-source-models

Prime ha annunciato il rilascio pubblico di Prime Inference, una piattaforma di serving che esegue modelli open source su cluster di GPU. Il servizio supporta sia la capacità serverless sia quella riservata e include il failover automatico tra data center. Il primo endpoint pubblico, GLM‑5.3, è stato reso disponibile su OpenRouter il 22 settembre e non ha registrato errori nelle chiamate agli strumenti, garantendo uptime continuo.

Prime Inference utilizza GPU NVIDIA Blackwell e uno stack basato su Dynamo, vLLM, Mooncake e FlashInfer. Offre inoltre un’API compatibile con OpenAI, utilizzabile con qualsiasi SDK esistente.

## I fatti

- Prime Inference è stato lanciato pubblicamente il 22 settembre 2026 con il modello GLM‑5.3.
- Il servizio funziona su GPU NVIDIA Blackwell e ha garantito un uptime del 100% dal lancio.

## Perché conta

Gli sviluppatori possono ora distribuire modelli open source su scala di produzione e ottenere inferenza affidabile e a bassa latenza, senza dover realizzare una propria infrastruttura GPU.

## Fonti e riferimenti

1. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/pi-inference-launch) – Prime Intellect
2. [AnnouncementsOCT 02ND, 2026Prime Inference: Fast, Reliable Serving for Frontier Open Models](https://www.primeintellect.ai/blog/prime-inference) – Prime Intellect

Ultimo aggiornamento: 2026-10-02
