Amazon SageMaker HyperPod agora oferece suporte a verificações profundas de integridade de clusters do Slurm com provisionamento contínuo

Publicado: 9 de jul de 2026

Agora, o Amazon SageMaker HyperPod oferece verificações de integridade detalhadas para clusters orquestrados pelo Slurm criados com provisionamento contínuo, permitindo que você verifique proativamente e a qualquer momento a integridade de aceleradores de GPU em instâncias em execução. O provisionamento contínuo permite iniciar o treinamento rapidamente e escalar grupos de instâncias de forma assíncrona, evitando falhas do tipo “tudo ou nada”; agora, você também pode combinar essa flexibilidade com uma validação de hardware abrangente à medida que as instâncias entram em operação. Esse recurso aborda um desafio essencial: até mesmo um único nó com problemas de integridade pode desperdiçar horas de tempo de computação e atrasar workloads críticas.

Com as verificações de integridade detalhadas, você pode direcionar grupos inteiros de instâncias ou instâncias específicas para executar testes de estresse de hardware e testes de conectividade abrangentes antes de alocar recursos de computação para um trabalho. Como o provisionamento contínuo adiciona nós de processamento ao seu cluster do Slurm de forma assíncrona, à medida que a capacidade se torna disponível, você pode realizar verificações de integridade aprofundadas em cada novo nó assim que ele entra em operação, validando o hardware antes de agendar tarefas nele e sem interromper as workloads que já estão sendo executadas em nós íntegros. O progresso e os resultados são visíveis no nível do grupo de instâncias e da instância por meio do console e das APIs do SageMaker, oferecendo visibilidade completa da integridade de GPUs, da conectividade de rede e do desempenho da comunicação com vários nós. As instâncias submetidas a verificações são isoladas automaticamente do agendamento de workloads e retornam ao serviço após a aprovação. Quando usadas em conjunto com o recurso de recuperação automática de nós do HyperPod, as instâncias que falham são automaticamente reinicializadas ou substituídas, garantindo a integridade do cluster.

Esse recurso está disponível em todas as regiões que oferecem o Amazon SageMaker HyperPod. Para saber mais sobre as verificações profundas de integridade e o provisionamento contínuo sob demanda, consulte o Guia do usuário do Amazon SageMaker HyperPod.