O Amazon SageMaker HyperPod agora oferece suporte à topologia em nível de partição para clusters orquestrados do Slurm

Publicado: 17 de jul de 2026

O Amazon SageMaker HyperPod agora oferece suporte à configuração da topologia de rede no nível da partição para clusters orquestrados do Slurm. Agora, um único cluster pode executar a topologia em árvore em uma partição e a topologia de blocos em outra, com cada partição usando a topologia mais adequada aos seus tipos de instância. Isso melhora o desempenho do treinamento distribuído ao manter a colocação profissional alinhada às características de interconexão de cada tipo de instância, para que a comunicação entre GPUs seja mais rápida, as operações coletivas da NCCL sejam mais eficientes e o rendimento do treinamento melhore.

O HyperPod determina a topologia de cada partição com base nos tipos de instância de seus grupos de instâncias de computação. Partições com tipos de instância do Amazon EC2 UltraServer, como ml.p6e-gb200.36xlarge, usam topologia de blocos, e aquelas com tipos de instância de interconexão hierárquica, como ml.p5.48xlarge, ml.p5e.48xlarge e ml.p5en.48xlarge, usam topologia em árvore, enquanto partições com tipos de instância que não fornecem informações de topologia de rede permanecem totalmente programáveis. O HyperPod mantém essa configuração automaticamente à medida que o cluster muda por meio de eventos de aumento, redução de escala e substituição de nós, de modo que a topologia de cada partição sempre reflita o estado atual do cluster.

Para começar, crie ou atualize um cluster SageMaker HyperPod Slurm executando o Slurm 25.11 ou posterior com tipos de instância de GPU compatíveis. O agendamento com reconhecimento de topologia está habilitado por padrão e não requer configuração. Esse atributo está disponível em todas as regiões da AWS nas quais o Amazon SageMaker HyperPod é oferecido. Para saber mais, consulte Como usar o agendamento com reconhecimento de topologia no Amazon SageMaker HyperPod.