Amazon SageMaker HyperPod artık Slurm tarafından düzenlenen kümeler için bölüm düzeyinde topolojiyi destekliyor
Amazon SageMaker HyperPod artık Slurm tarafından düzenlenen kümeler için bölüm düzeyinde ağ topolojisi yapılandırmasını destekliyor. Tek bir küme artık bir bölümde ağaç topolojisi, diğerinde blok topolojisini çalıştırabilir ve her bölüm kendi bulut sunucusu türlerine en uygun topolojiyi kullanır. Bu, iş yerleştirmeyi her bulut sunucusu türünün ara bağlantı özellikleriyle uyumlu tutarak dağıtılmış eğitim performansını artırır, böylece GPU'dan GPU'ya iletişim hızlanır, NCCL toplu işlemleri daha verimli olur ve eğitim verimi artar.
HyperPod, bilgi işlem bulut sunucusu grubunun bulut sunucusu türlerine göre her bölüm için topolojiyi belirler. ml.p6e-gb200.36xlarge gibi Amazon EC2 UltraServer bulut sunucusu türlerine sahip bölümler blok topolojisini kullanır ve ml.p5.48xlarge, ml.p5e.48xlarge ve ml.p5en.48xlarge gibi hiyerarşik ara bağlantı bulut sunucusu türlerine sahip bölümler ise ağaç topolojisini kullanır. Bu sırada ağ topolojisi bilgisi sağlamayan bulut sunucusu türlerine sahip bölümler tam olarak zamanlanabilir kalır. HyperPod, küme ölçeklendirme, küçültme ve düğüm değiştirme olayları yoluyla değiştikçe bu yapılandırmayı otomatik olarak korur, böylece her bölümün topolojisi her zaman kümenin mevcut durumunu yansıtır.
Başlamak için, desteklenen GPU bulut sunucusu türleriyle Slurm 25.11 veya sonraki bir sürümünü çalıştıran bir SageMaker HyperPod Slurm kümesi oluşturun veya güncelleyin. Topolojiye duyarlı zamanlama varsayılan olarak etkindir ve yapılandırma gerektirmez. Bu özellik, Amazon SageMaker HyperPod'un desteklendiği tüm AWS Bölgelerinde kullanılabilir. Daha fazla bilgi edinmek için Amazon SageMaker HyperPod'da topolojiye duyarlı zamanlamayı kullanma sayfasına bakın.