Amazon SageMaker HyperPod 现已支持 Slurm 编排集群的分区级拓扑

发布于: 2026年7月17日

Amazon SageMaker HyperPod 现已支持 Slurm 编排集群的分区级别的网络拓扑配置。现在,单个集群可以在一个分区中运行树拓扑,并在另一个分区中运行块拓扑,并且每个分区均使用最适合其实例类型的拓扑。这将使作业放置与每种实例类型的互连特性保持一致,从而提升分布式训练性能,这使得 GPU 之间通信速度更快,NCCL 集合操作更高效,训练吞吐量也随之提升。

HyperPod 会根据其计算实例组的实例类型来确定每个分区的拓扑。具有 Amazon EC2 UltraServer 实例类型(例如,ml.p6e-gb200.36xlarge)的分区使用块拓扑,具有分层互连实例类型(例如,ml.p5.48xlarge、ml.p5e.48xlarge 和 ml.p5en.48xlarge)的分区使用树拓扑,而未提供网络拓扑信息的实例类型所在的分区仍可正常调度。当集群通过扩展、缩减和节点替换事件发生变化时,HyperPod 会自动维护此配置,因此每个分区的拓扑始终会反映集群的当前状态。

要开始使用,请使用受支持的 GPU 实例类型来创建或更新运行 Slurm 25.11 或更高版本的 SageMaker HyperPod Slurm 集群。拓扑感知安排在默认情况下处于启用状态,无需配置。此功能现已在支持 Amazon SageMaker HyperPod 的所有 AWS 区域推出。要了解更多信息,请参阅在 Amazon SageMaker HyperPod 中使用拓扑感知安排