Amazon SageMaker HyperPod kini mendukung topologi tingkat partisi untuk klaster yang diorkestrasi oleh Slurm
Amazon SageMaker HyperPod kini mendukung konfigurasi topologi jaringan pada tingkat partisi untuk klaster yang diatur oleh Slurm. Kini, satu klaster dapat menjalankan topologi pohon di satu partisi dan topologi blok di partisi lain, dengan setiap partisi menggunakan topologi yang paling sesuai dengan tipe instans-nya. Hal ini meningkatkan kinerja pelatihan terdistribusi dengan menjaga penempatan pekerjaan tetap selaras dengan karakteristik interkoneksi setiap jenis instans interkoneksi, sehingga komunikasi GPU-ke-GPU lebih cepat, operasi kolektif NCCL lebih efisien, dan throughput pelatihan meningkat.
HyperPod menentukan topologi untuk setiap partisi berdasarkan tipe instans dari grup instans komputasinya. Partisi dengan tipe instans Amazon EC2 UltraServer seperti ml.p6e-gb200.36xlarge menggunakan topologi blok, dan partisi dengan tipe instans interkoneksi hierarkis seperti ml.p5.48xlarge, ml.p5e.48xlarge, dan ml.p5en.48xlarge menggunakan topologi pohon, sementara partisi dengan tipe instans yang tidak menyediakan informasi topologi jaringan tetap dapat dijadwalkan sepenuhnya. HyperPod secara otomatis mempertahankan konfigurasi ini seiring perubahan klaster melalui peristiwa peningkatan skala, penurunan skala, dan penggantian simpul, sehingga topologi setiap partisi selalu mencerminkan keadaan klaster saat ini.
Untuk memulai, buat atau perbarui klaster SageMaker HyperPod Slurm yang menjalankan Slurm 25.11 atau versi yang lebih baru dengan tipe instans GPU yang didukung. Penjadwalan sadar topologi diaktifkan secara default dan tidak memerlukan konfigurasi apa pun. Fitur ini tersedia di semua AWS Region di mana Amazon SageMaker HyperPod didukung. Untuk mempelajari lebih lanjut, lihat Menggunakan penjadwalan sadar topologi di Amazon SageMaker HyperPod.