Amazon SageMaker HyperPod, 이제 Slurm 오케스트레이션된 클러스터에 파티션 수준 토폴로지를 지원
Amazon SageMaker HyperPod는 이제 Slurm 오케스트레이션된 클러스터의 파티션 수준에서 네트워크 토폴로지 구성을 지원합니다. 이제 단일 클러스터에서 한 파티션은 트리 토폴로지를 실행하고 다른 파티션은 블록 토폴로지를 실행하여, 각 파티션이 인스턴스 유형에 가장 적합한 토폴로지를 사용하게 됩니다. 이렇게 하면 각 인스턴스 유형의 인터커넥트 특성에 맞게 작업 배치를 조정하여 분산 훈련 성능이 향상되므로 GPU 간 통신이 더 빨라지고 NCCL 집합 연산 효율성과 훈련 처리량이 개선됩니다.
HyperPod는 컴퓨팅 인스턴스 그룹의 인스턴스 유형을 기반으로 각 파티션의 토폴로지를 결정합니다. ml.p6e-gb200.36xlarge와 같은 Amazon EC2 UltraServer 인스턴스 유형을 사용하는 파티션은 블록 토폴로지를 사용하고, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge와 같은 계층적 인터커넥트 인스턴스 유형을 사용하는 파티션은 트리 토폴로지를 사용하는 반면, 네트워크 토폴로지 정보를 제공하지 않는 인스턴스 유형의 파티션은 계속해서 완전히 스케줄링이 가능합니다. HyperPod는 스케일 업, 스케일 다운 및 노드 교체 이벤트를 통해 클러스터가 변경될 때 이 구성을 자동으로 유지하므로 각 파티션의 토폴로지는 항상 클러스터의 현재 상태를 반영합니다.
시작하려면 지원되는 GPU 인스턴스 유형을 사용하여 Slurm 25.11 이상을 실행하는 SageMaker HyperPod Slurm 클러스터를 생성하거나 업데이트하세요. 토폴로지 인식 스케줄링은 기본적으로 활성화되어 있으며 구성이 필요하지 않습니다. 이 기능은 Amazon SageMaker HyperPod가 제공되는 모든 AWS 리전에서 사용할 수 있습니다. 자세한 내용은 Amazon SageMaker HyperPod에서 토폴로지 인식 스케줄링 사용을 참조하세요.