Prime ha annunciato il rilascio pubblico di Prime Inference, una piattaforma di serving che esegue modelli open source su cluster di GPU. Il servizio supporta sia la capacità serverless sia quella riservata e include il failover automatico tra data center. Il primo endpoint pubblico, GLM‑5.3, è stato reso disponibile su OpenRouter il 22 settembre e non ha registrato errori nelle chiamate agli strumenti, garantendo uptime continuo.
Prime Inference utilizza GPU NVIDIA Blackwell e uno stack basato su Dynamo, vLLM, Mooncake e FlashInfer. Offre inoltre un’API compatibile con OpenAI, utilizzabile con qualsiasi SDK esistente.
Perché conta
Gli sviluppatori possono ora distribuire modelli open source su scala di produzione e ottenere inferenza affidabile e a bassa latenza, senza dover realizzare una propria infrastruttura GPU.