Amazon Web Services a annoncé que le modèle GLM 5.3 de Z.ai (également connu sous le nom de Zhipu AI) est désormais disponible sur sa plateforme Bedrock. Le modèle compte 753 milliards de paramètres et repose sur une architecture à mélange d’experts : il peut ainsi répartir différentes parties d’une requête entre des sous-modèles spécialisés afin de gagner en efficacité. Les utilisateurs de Bedrock peuvent appeler GLM 5.3 via les mêmes API compatibles avec OpenAI qu’ils utilisent déjà, sans avoir à gérer eux-mêmes de matériel.
Qu’apporte GLM 5.3 ?
GLM 5.3 est optimisé pour les longues tâches de programmation et les flux de travail agentiques nécessitant de conserver un vaste contexte, par exemple la refactorisation d’une base de code répartie sur des centaines de fichiers. Z.ai met également en avant ses performances en cybersécurité, avec notamment un score de 84,5 au benchmark CyberGym. Sur Bedrock, le modèle bénéficie de la mise en cache des prompts, de l’inférence interrégionale et de trois niveaux de service (Flex, Standard, Priority), qui permettent de faire un compromis entre coût et latence.
Comment commencer à l’utiliser
Les entreprises clientes admissibles peuvent activer le modèle depuis l’onglet Playground de la console Bedrock, sans écrire de code. Les développeurs peuvent appeler le modèle via les API Responses ou Chat Completions compatibles avec OpenAI, ou utiliser les appels natifs Invoke et Converse de Bedrock. L’article de blog présente également un exemple de script Python qui envoie une demande de refactorisation au modèle à l’aide de jetons AWS de courte durée.
Pourquoi c'est important
Les entreprises peuvent désormais utiliser un modèle de programmation et de sécurité de très grande taille sans acheter de serveurs équipés de GPU, ce qui réduit les coûts initiaux et simplifie la conformité. La mise en cache des prompts intégrée peut réduire la latence et les frais liés aux jetons lors de longues sessions d’analyse de code. Toutefois, le modèle est réservé aux comptes d’entreprise admissibles et les tarifs ne sont pas communiqués : les économies exactes restent donc incertaines.