Amazon SageMaker HyperPod unterstützt jetzt die Topologie auf Partitionsebene für von Slurm orchestrierte Cluster

Veröffentlicht am: 17. Juli 2026

Amazon SageMaker HyperPod unterstützt jetzt die Netzwerktopologiekonfiguration auf Partitionsebene für von Slurm orchestrierte Cluster. Ein einzelner Cluster kann jetzt eine Baumtopologie in einer Partition und eine Blocktopologie in einer anderen ausführen, wobei jede Partition die Topologie verwendet, die für ihre Instanztypen am besten geeignet ist. Dadurch wird verteilte Trainingsperformance verbessert, da die Aufgabenvermittlung an die Verbindungsmerkmale der einzelnen Instance-Typen angepasst wird, sodass die GPU-zu-GPU-Kommunikation schneller ist, kollektive NCCL-Operationen effizienter sind und der Trainingsdurchsatz verbessert wird.

HyperPod bestimmt die Topologie für jede Partition auf der Grundlage der Instance-Typen seiner Compute-Instance-Gruppen. Partitionen mit Amazon EC2 UltraServer-Instance-Typen wie ml.p6e-gb200.36xlarge verwenden eine Blocktopologie, und solche mit hierarchischen Interconnect-Instance-Typen wie ml.p5.48xlarge, ml.p5e.48xlarge und ml.p5en.48xlarge verwenden eine Baumtopologie, während Partitionen mit Instance-Typen, die keine Informationen zur Netzwerktopologie bereitstellen, vollständig planbar bleiben. HyperPod behält diese Konfiguration automatisch bei, wenn sich der Cluster durch Hochskalieren, Herunterskalieren und Node-Replace-Events ändert, sodass die Topologie jeder Partition immer den aktuellen Status des Clusters widerspiegelt.

Erstellen oder aktualisieren Sie zunächst einen SageMaker HyperPod Slurm-Cluster, der auf Slurm 25.11 oder höher mit unterstützten GPU-Instance-Typen ausgeführt wird. Die topologiebezogene Planung ist standardmäßig aktiviert und erfordert keine Konfiguration. Diese Funktion ist in allen AWS-Regionen verfügbar, in denen Amazon SageMaker HyperPod unterstützt wird. Weitere Informationen finden Sie unter Verwenden topologiebezogener Planung in Amazon SageMaker HyperPod.