Amazon SageMaker HyperPod รองรับโทโพโลยีระดับพาร์ทิชันสำหรับคลัสเตอร์ที่ควบคุมระบบด้วย Slurm

โพสต์บน: 17 ก.ค. 2026

ขณะนี้ Amazon SageMaker HyperPod รองรับการกำหนดค่าโทโพโลยีเครือข่ายในระดับพาร์ทิชันสำหรับคลัสเตอร์ที่ควบคุมระบบด้วย Slurm ขณะนี้ คลัสเตอร์เดียวสามารถใช้โทโพโลยีแบบทรีในพาร์ทิชันหนึ่ง และใช้โทโพโลยีแบบบล็อกในอีกพาร์ทิชันหนึ่งได้ โดยแต่ละพาร์ทิชันจะใช้โทโพโลยีที่เหมาะสมที่สุดกับประเภทอินสแตนซ์ของตน การเปลี่ยนแปลงนี้ช่วยปรับปรุงประสิทธิภาพของการฝึกแบบกระจาย โดยจัดตำแหน่งการวางงานให้สอดคล้องกับลักษณะของ Interconnect ของอินสแตนซ์แต่ละประเภท ส่งผลให้การสื่อสารระหว่าง GPU ทำได้รวดเร็วขึ้น การดำเนินการแบบกลุ่มของ NCCL มีประสิทธิภาพมากขึ้น และอัตราการโอนถ่ายข้อมูลของการฝึกดีขึ้น

HyperPod จะกำหนดโทโพโลยีสำหรับแต่ละพาร์ทิชันโดยอิงตามประเภทอินสแตนซ์ของกลุ่มอินสแตนซ์ประมวลผลแต่ละกลุ่ม พาร์ทิชันที่ใช้ประเภทอินสแตนซ์ Amazon EC2 UltraServer เช่น ml.p6e-gb200.36xlarge จะใช้โทโพโลยีแบบบล็อก ส่วนพาร์ทิชันที่ใช้ประเภทอินสแตนซ์ที่มี Hierarchical Interconnect เช่น ml.p5.48xlarge, ml.p5e.48xlarge และ ml.p5en.48xlarge จะใช้โทโพโลยีแบบทรี ขณะที่พาร์ทิชันที่ใช้ประเภทอินสแตนซ์ซึ่งไม่ได้ให้ข้อมูลโทโพโลยีเครือข่ายจะยังคงสามารถจัดกำหนดการได้อย่างเต็มรูปแบบ HyperPod จะรักษาการกำหนดค่านี้ไว้โดยอัตโนมัติเมื่อคลัสเตอร์มีการเปลี่ยนแปลงจากเหตุการณ์การขยายขนาดระบบ การลดขนาดระบบ และการแทนที่โหนด เพื่อให้โทโพโลยีของแต่ละพาร์ทิชันสะท้อนสถานะปัจจุบันของคลัสเตอร์อยู่เสมอ

ในการเริ่มต้นใช้งาน ให้สร้างหรืออัปเดตคลัสเตอร์ SageMaker HyperPod Slurm ซึ่งใช้ Slurm 25.11 หรือใหม่กว่า พร้อมประเภทอินสแตนซ์ GPU ที่รองรับ การกำหนดเวลาที่คำนึงถึงโทโพโลยีถูกเปิดใช้งานโดยค่าเริ่มต้น และไม่ต้องมีการตั้งค่าเพิ่มเติม ฟีเจอร์นี้พร้อมใช้งานใน AWS Region ทุกแห่งที่รองรับ Amazon SageMaker HyperPod หากต้องการเรียนรู้เพิ่มเติม โปรดดูการใช้การกำหนดเวลาที่คำนึงถึงโทโพโลยีใน Amazon SageMaker HyperPod