A Amazon Web Services anunciou que o modelo GLM 5.3, da Z.ai (também conhecida como Zhipu AI), já está disponível na plataforma Bedrock. O modelo tem 753 bilhões de parâmetros e usa uma arquitetura de mistura de especialistas, que encaminha partes de uma solicitação a submodelos especializados para ganhar eficiência. Os usuários do Bedrock podem acessar o GLM 5.3 pelas mesmas APIs compatíveis com OpenAI que já utilizam, sem precisar operar hardware próprio.
O que o GLM 5.3 oferece?
O GLM 5.3 foi ajustado para tarefas de programação prolongadas e fluxos de trabalho com agentes que precisam manter grandes volumes de contexto, como refatorar uma base de código com centenas de arquivos. A Z.ai também destaca o desempenho em cibersegurança e cita a pontuação máxima de 84,5 no benchmark CyberGym. No Bedrock, o modelo conta com cache de prompts, inferência entre regiões e três níveis de serviço (Flex, Standard e Priority), que permitem equilibrar custo e latência.
Como começar a usar
Clientes corporativos elegíveis podem ativar o modelo na aba Playground do console do Bedrock, sem precisar escrever código. Desenvolvedores podem invocá-lo pelas APIs Responses ou Chat Completions, compatíveis com OpenAI, ou pelas chamadas nativas Invoke e Converse do Bedrock. A publicação no blog também apresenta um exemplo de script em Python que envia ao modelo uma solicitação de refatoração usando tokens temporários da AWS.
Por que importa
Empresas agora podem usar um modelo de grande porte para programação e segurança sem comprar servidores com GPUs, reduzindo os custos iniciais e simplificando a conformidade. O cache de prompts integrado pode diminuir a latência e os custos com tokens em sessões prolongadas de análise de código. No entanto, o modelo está restrito a contas corporativas elegíveis e os preços não foram divulgados, portanto ainda não é possível determinar a economia exata.