Os modelos GLM-5.2 FP8, NVIDIA-Nemotron-Nano-12b-v2 e GLM-OCR já estão disponíveis no Amazon SageMaker JumpStart

Publicado: 10 de ago de 2026

Os modelos GLM-5.2 FP8 da Z.ai, Nemotron-nano-12B-v2 da NVIDIA e GLM-OCR da Z.ai estão agora disponíveis no Amazon SageMaker JumpStart, expandindo o portfólio de modelos básicos disponíveis para clientes da AWS. Esses três modelos oferecem recursos especializados que abrangem engenharia agente de longo prazo, raciocínio híbrido eficiente e compreensão avançada de documentos, permitindo que os clientes implantem soluções de IA escaláveis e de alto desempenho na infraestrutura da AWS.

O GLM-5.2 FP8 é otimizado para tarefas de longo prazo e fluxos de trabalho de engenharia autênticos, como o desenvolvimento de software de ciclo completo, desde os requisitos até a implantação. Ele oferece um salto substancial na capacidade de tarefas de longo prazo em relação ao seu antecessor GLM-5.1 e, pela primeira vez, fornece uma janela de contexto verdadeiramente utilizável de 1 milhão de tokens, permitindo lidar com o contexto de engenharia em nível de projeto, executar tarefas de longa duração de forma confiável, seguir os padrões de engenharia de forma consistente e concluir fluxos de trabalho completos de desenvolvimento em uma única tarefa.

O NVIDIA-Nemotron-Nano-12B-v2 se destaca em tarefas unificadas de raciocínio e não raciocínio com throughput de alto rendimento de inferência, tornando-o ideal para aplicativos corporativos que exigem precisão e eficiência. Ele usa uma arquitetura híbrida Mamba-2 e Transformer com um comprimento de contexto de 128K, gerando traços de raciocínio antes de concluir com as respostas finais. Seu design compacto de parâmetros de 12B alcança uma precisão comparável ou melhor do que os principais modelos abertos, ao mesmo tempo em que oferece um throughput de inferência até 6 vezes maior.

O GLM-OCR fornece uma compreensão precisa, rápida e abrangente de documentos para materiais complexos do mundo real, incluindo PDFs digitalizados, notas manuscritas, trabalhos acadêmicos densos com fórmulas, tabelas com várias colunas, documentação de código e texto multilíngue. Esse modelo multimodal de 0,9B de parâmetros reconstrói estruturas, tabelas e fórmulas em Markdown, JSON ou LaTeX limpos, com latência baixa o suficiente para serviços em tempo real e dispositivos de ponta, ideal para fluxos de trabalho de processamento de documentos e extração de faturas em grande escala.

Com o SageMaker JumpStart, os clientes podem implantar qualquer um desse modelos com apenas alguns cliques para abordar casos de uso de IA específicos.

Para começar a usar esses modelos, navegue até o catálogo de modelos do SageMaker JumpStart no SageMaker Studio ou use o SageMaker Python SDK para implantá-los na sua conta da AWS. Para obter mais informações sobre a implantação e o uso de modelos de base no SageMaker JumpStart, consulte a documentação do Amazon SageMaker JumpStart.