Oossa

Prime lancia una piattaforma di inferenza per modelli open source

Prime Inference, una nuova piattaforma di serving per modelli open di frontiera, debutta con GLM‑5.3 su OpenRouter, con bassa latenza e uptime del 100%.

BreveOossaPubblicato da Oossa: 1 min di lettura

Prime ha annunciato il rilascio pubblico di Prime Inference, una piattaforma di serving che esegue modelli open source su cluster di GPU. Il servizio supporta sia la capacità serverless sia quella riservata e include il failover automatico tra data center. Il primo endpoint pubblico, GLM‑5.3, è stato reso disponibile su OpenRouter il 22 settembre e non ha registrato errori nelle chiamate agli strumenti, garantendo uptime continuo.

Prime Inference utilizza GPU NVIDIA Blackwell e uno stack basato su Dynamo, vLLM, Mooncake e FlashInfer. Offre inoltre un’API compatibile con OpenAI, utilizzabile con qualsiasi SDK esistente.

Perché conta

Gli sviluppatori possono ora distribuire modelli open source su scala di produzione e ottenere inferenza affidabile e a bassa latenza, senza dover realizzare una propria infrastruttura GPU.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.