A inferência de IA do Amazon SageMaker agora oferece suporte a instâncias G7
A inferência de IA do Amazon SageMaker agora oferece suporte a instâncias G7 equipadas com GPUs NVIDIA RTX PRO 4500 Blackwell Server Edition, permitindo que você implante modelos de aprendizado de máquina com desempenho de inferência de IA até 4,6 vezes em comparação com instâncias G6 da geração anterior. Os clientes que implantam modelos de IA generativos para inferência de produção precisam de alta taxa de transferência de GPU e capacidade de memória para atender modelos de médio a grande porte de forma econômica, mas as instâncias da geração anterior geralmente exigiam o provisionamento excessivo de modelos caros de computação ou quantização para se adequarem às restrições de memória.
As instâncias G7 fornecem 32 GB de memória de GPU por GPU com núcleos tensores de 5ª geração, até 700 Gbps de rede habilitada para EFA (7 vezes em comparação com G6) e até 7,6 TB de armazenamento SSD NVMe local para manter modelos grandes próximos à computação. Esses recursos tornam as instâncias G7 adequadas para atender modelos na faixa de parâmetros de 7B—30B, cargas de trabalho de geração de imagem e vídeo e endpoints de inferência de vários modelos que se beneficiam de maior largura de banda e taxa de transferência de memória. Você pode implantar modelos em instâncias do G7 usando o console, a API ou o SDK do SageMaker AI Inference especificando os tipos de instância do G7 (como ml.g7.xlarge a ml.g7.48xlarge) na configuração do seu endpoint.
As instâncias G7 para inferência de IA do SageMaker estão disponíveis no Leste dos EUA (Norte da Virgínia, Ohio) e Oeste dos EUA (Oregon). Para obter informações sobre os preços dessas instâncias, acesse a página de preços.