AWS PCS รองรับ GRES แบบกำหนดเอง, โทโพโลยีฮาร์ดแวร์ และ MIG แล้ว

โพสต์บน: 11 ก.ย. 2026

ขณะนี้ AWS Parallel Computing Service (AWS PCS) รองรับการตั้งค่า Generic Resource (GRES) แบบกำหนดเองและโทโพโลยีฮาร์ดแวร์ และเพิ่มการรองรับ Slurm เวอร์ชัน 26.05 แล้ว ความสามารถเหล่านี้ช่วยให้คุณควบคุมวิธีที่ Slurm มองเห็นและกำหนดเวลาการใช้งานฮาร์ดแวร์ในคลัสเตอร์ของคุณได้ละเอียดยิ่งขึ้น ซึ่งช่วยปรับปรุงการจัดวางงานสำหรับเวิร์กโหลด HPC และแมชชีนเลิร์นนิง นอกจากนี้ ความสามารถเหล่านี้ยังรองรับ NVIDIA Multi-Instance GPU (MIG) ซึ่งแบ่ง GPU หนึ่งตัวออกเป็นอินสแตนซ์ที่แยกจากกัน โดย Slurm จะกำหนดเวลาใช้งานแต่ละอินสแตนซ์ได้อย่างอิสระอีกด้วย

เมื่อใช้ Slurm 26.05 แล้ว AWS PCS จะกำหนดค่าโทโพโลยีฮาร์ดแวร์ตามค่าเริ่มต้น โดยถือว่าโดเมน NUMA ของแต่ละโหนดเป็นซ็อกเก็ตของ Slurm นอกจากนี้ ยังตรวจจับและกำหนดค่าการผูก GPU กับคอร์และ Interconnect ระหว่าง GPU บนโหนด GPU โดยอัตโนมัติ ขณะนี้ งาน MPI ที่เชื่อมโยงกันอย่างแน่นหนาสามารถเพิ่มประสิทธิภาพการจัดวาง Rank โดยใช้การผูกกับซ็อกเก็ต และงาน GPU จะถูกจัดวางบนคอร์ที่อยู่ภายในเครื่องเดียวกับ GPU ที่ได้รับการจัดสรร การตั้งค่า Slurm และ GRES แบบกำหนดเองช่วยเพิ่มความยืดหยุ่นเมื่อคุณต้องการ คุณสามารถประกาศตัวเร่งเพิ่มเติม, แบ่ง GPU ด้วย MIG, ใช้โดเมนแคช L3 เป็นซ็อกเก็ต หรือแทนที่ค่าเริ่มต้นของ AWS PCS

AWS PCS เป็นบริการแบบมีการจัดการที่ช่วยลดความซับซ้อนในการรันและปรับขนาดเวิร์กโหลดการประมวลผลประสิทธิภาพสูง (HPC) บน AWS โดยใช้ Slurm คุณสามารถสร้างสภาพแวดล้อมที่ครบถ้วนและยืดหยุ่น ซึ่งผสานรวมการประมวลผล พื้นที่จัดเก็บข้อมูล ระบบเครือข่าย และเครื่องมือการแสดงผล โดยบริการจะจัดการการอัปเดตคลัสเตอร์ให้ พร้อมทั้งมีความสามารถในการสังเกตการณ์ในตัว

ความสามารถเหล่านี้พร้อมใช้งานใน AWS Region ทุกแห่งที่มี AWS PCS ให้บริการ Slurm 26.05 ยังมาพร้อมกับการปรับปรุงด้านการกำหนดเวลาและข้อมูลการสังเกตที่ครอบคลุมยิ่งขึ้น ดังที่อธิบายไว้ในบันทึกย่อประจำรุ่น Slurm 26.05 ดูข้อมูลเพิ่มเติมได้ที่การกำหนดการตั้งค่า GRES แบบกำหนดเอง, การกำหนดค่าโทโพโลยีฮาร์ดแวร์ และการกำหนดค่า Multi-Instance GPU (MIG) ในคู่มือผู้ใช้ AWS PCS