Amazon SageMaker HyperPod ora supporta la topologia a livello di partizione per i cluster orchestrati da Slurm
Amazon SageMaker HyperPod ora supporta la configurazione della topologia di rete a livello di partizione per i cluster orchestrati da Slurm. Un singolo cluster può ora utilizzare la topologia ad albero in una partizione e la topologia a blocchi in un'altra, con ciascuna partizione che utilizza la topologia più adatta ai suoi tipi di istanza. Ciò migliora le prestazioni di addestramento distribuito mantenendo il posizionamento dei job allineato alle caratteristiche di interconnessione di ciascun tipo di istanza, in modo che la comunicazione GPU-to-GPU sia più veloce, le operazioni collettive NCCL siano più efficienti e il throughput di addestramento migliori.
HyperPod determina la topologia per ogni partizione in base ai tipi di istanza dei suoi gruppi di istanze di calcolo. Le partizioni con tipi di istanza Amazon EC2 UltraServer come ml.p6e-gb200.36xlarge utilizzano la topologia a blocchi, e quelle con tipi di istanza a interconnessione gerarchica come ml.p5.48xlarge, ml.p5e.48xlarge e ml.p5en.48xlarge utilizzano la topologia ad albero, mentre le partizioni con tipi di istanza che non forniscono informazioni sulla topologia di rete rimangono completamente pianificabili. HyperPod mantiene questa configurazione automaticamente man mano che il cluster cambia in seguito a eventi di scale-up, scale-down e sostituzione dei nodi, in modo che la topologia di ogni partizione rifletta sempre lo stato corrente del cluster.
Per iniziare, crea o aggiorna un cluster SageMaker HyperPod Slurm che esegue Slurm 25.11 o versioni successive, con i tipi di istanza GPU supportati. La pianificazione basata sulla topologia è abilitata per impostazione predefinita e non richiede configurazioni. Questa funzionalità è disponibile in tutte le regioni AWS in cui è supportato Amazon SageMaker HyperPod. Per ulteriori informazioni, consulta Utilizzo della pianificazione basata sulla topologia in Amazon SageMaker HyperPod.