Amazon Web Services ha annunciato che il modello GLM 5.3 di Z.ai (nota anche come Zhipu AI) è ora disponibile sulla piattaforma Bedrock. Il modello ha 753 miliardi di parametri ed è basato su un’architettura mixture-of-experts: può quindi indirizzare parti di una richiesta a sottomodelli specializzati, per lavorare in modo più efficiente. Gli utenti di Bedrock possono richiamare GLM 5.3 tramite le stesse API compatibili con OpenAI che già utilizzano, senza dover gestire hardware.
Cosa offre GLM 5.3?
GLM 5.3 è ottimizzato per attività di programmazione di lunga durata e flussi di lavoro agentici che devono mantenere molto contesto, come il refactoring di una base di codice composta da centinaia di file. Z.ai sottolinea anche le prestazioni elevate in ambito di cybersicurezza, citando il punteggio massimo di 84.5 nel benchmark CyberGym. Su Bedrock, il modello supporta la memorizzazione nella cache dei prompt, l’inferenza tra regioni e tre livelli di servizio (Flex, Standard, Priority), che consentono di bilanciare costi e latenza.
Come iniziare a usarlo
I clienti aziendali idonei possono attivare il modello dalla scheda Playground della console Bedrock, senza scrivere codice. Gli sviluppatori possono richiamarlo tramite le API Responses o Chat Completions compatibili con OpenAI, oppure con le chiamate native Invoke e Converse di Bedrock. Il post sul blog mostra anche uno script Python di esempio che invia al modello una richiesta di refactoring usando token AWS a breve scadenza.
Perché conta
Le aziende possono ora usare un modello di grandi dimensioni per la programmazione e la sicurezza senza acquistare server GPU, riducendo i costi iniziali e semplificando la conformità. La memorizzazione nella cache dei prompt integrata può ridurre la latenza e i costi dei token nelle sessioni prolungate di analisi del codice. Tuttavia, il modello è riservato agli account aziendali idonei e i prezzi non sono stati comunicati, quindi non è possibile stimare con precisione i risparmi.