Amazon SageMaker HyperPod รองรับการตรวจสอบสถานะเชิงลึกสำหรับคลัสเตอร์ Slurm ที่ใช้การจัดสรรทรัพยากรอย่างต่อเนื่องแล้ว

โพสต์บน: 9 ก.ค. 2026

Amazon SageMaker HyperPod รองรับการตรวจสอบสถานะเชิงลึกสำหรับคลัสเตอร์ที่จัดระเบียบโดย Slurm ซึ่งสร้างขึ้นด้วยการจัดเตรียมอย่างต่อเนื่อง ทำให้คุณสามารถตรวจสอบสถานะของตัวเร่งความเร็ว GPU บนอินสแตนซ์ที่กำลังทำงานอยู่ได้ตลอดเวลา การจัดสรรอย่างต่อเนื่องช่วยให้คุณเริ่มต้นการฝึกได้อย่างรวดเร็วและปรับขนาดกลุ่มอินสแตนซ์แบบอะซิงโครนัสโดยไม่มีความล้มเหลวแบบ All-or-Nothing และตอนนี้คุณสามารถผสานความยืดหยุ่นนั้นเข้ากับการตรวจสอบฮาร์ดแวร์อย่างครอบคลุมเมื่ออินสแตนซ์ออนไลน์ได้แล้ว ความสามารถนี้ตอบสนองต่อความท้าทายที่สำคัญที่แม้แต่โหนดที่ไม่ดีต่อสุขภาพก็สามารถเสียเวลาในการคำนวณหลายชั่วโมงและชะลอเวิร์กโหลดที่สำคัญได้

การตรวจสอบสถานะเชิงลึกทำให้คุณสามารถกำหนดเป้าหมายกลุ่มอินสแตนซ์ทั้งหมดหรืออินสแตนซ์เฉพาะเพื่อดำเนินการทดสอบความเครียดของฮาร์ดแวร์และการทดสอบการเชื่อมต่อที่ครอบคลุมก่อนที่จะใช้ทรัพยากรคำนวณให้กับงาน เนื่องจากการจัดสรรทรัพยากรอย่างต่อเนื่องจะเพิ่ม Worker Node ลงในคลัสเตอร์ Slurm ของคุณแบบอะซิงโครนัสเมื่อมีความสามารถในการรองรับว่าง คุณจึงสามารถตรวจสอบสถานะโดยละเอียดของแต่ละโหนดใหม่ได้ทันทีที่ออนไลน์ ตรวจสอบความถูกต้องของฮาร์ดแวร์ก่อนที่จะกำหนดตารางงานบนโหนดนั้น โดยไม่รบกวนเวิร์กโหลดที่กำลังทำงานอยู่บนโหนดที่อยู่ในสภาพดี ความคืบหน้าและผลลัพธ์สามารถมองเห็นได้ทั้งในกลุ่มอินสแตนซ์และระดับอินสแตนซ์ผ่านคอนโซล SageMaker และ API ทำให้สามารถมองเห็นได้อย่างสมบูรณ์เกี่ยวกับสุขภาพ GPU การเชื่อมต่อเครือข่าย และประสิทธิภาพการสื่อสารแบบหลายโหนด อินสแตนซ์ที่ผ่านการตรวจสอบจะถูกแยกออกจากการกำหนดเวลาเวิร์กโหลดโดยอัตโนมัติและกลับสู่บริการเมื่อผ่านแล้ว เมื่อจับคู่กับความสามารถในการกู้คืนโหนดอัตโนมัติของ HyperPod อินสแตนซ์ที่ล้มเหลวจะถูกรีบูตหรือแทนที่โดยอัตโนมัติ ทำให้มั่นใจได้ถึงสถานะของคลัสเตอร์

ความสามารถนี้สามารถใช้ได้ในทุกรีเจี้ยนที่มี Amazon SageMaker HyperPod ให้บริการ หากต้องการเรียนรู้เพิ่มเติมเกี่ยวกับการตรวจสอบสถานะเชิงลึกตามความต้องการและการจัดเตรียมอย่างต่อเนื่อง โปรดดูคู่มือผู้ใช้ Amazon SageMaker HyperPod