Amazon SageMaker HyperPod เพิ่มประสิทธิภาพการรองรับ Ray
ขณะนี้ Amazon SageMaker HyperPod เพิ่มประสิทธิภาพการรองรับ Ray ด้วยข้อมูลการสังเกตในตัว, การฝึกที่มีความยืดหยุ่น, การอนุมานแบบเร่งความเร็ว และสภาพแวดล้อมการพัฒนาที่มีการจัดการ Ray เป็นเฟรมเวิร์กแบบโอเพนซอร์สยอดนิยมสำหรับการปรับขนาดเวิร์กโหลด AI บนเลเยอร์การประมวลผลแบบครบวงจร ตั้งแต่การประมวลผลข้อมูลและการฝึกแบบกระจายตัวไปจนถึงการเรียนรู้แบบเสริมแรงและการให้บริการโมเดล การเรียกใช้ Ray บน Kubernetes ในระดับการใช้งานจริงอาจเป็นภาระด้านการดำเนินงาน ได้แก่ งานค้าง, การใช้งาน GPU ต่ำจากการจัดสรรแบบคงที่ของทีม และการตั้งค่าข้อมูลการสังเกตแบบหลายขั้นตอน นอกจากนี้ การไม่มีสภาพแวดล้อมการพัฒนาแบบโต้ตอบหมายความว่าการเปลี่ยนแปลงโค้ดทุกครั้งจำเป็นต้องส่งงานอีกครั้งและต้องมีความคุ้นเคยกับ kubectl อีกด้วย
ขณะนี้ HyperPod ช่วยให้การพัฒนาทำได้ง่ายขึ้น การฝึกมีความทนทาน และการอนุมานได้รับการเร่งความเร็วสำหรับ Ray นักวิทยาศาสตร์ข้อมูลสามารถสร้าง, แก้ไข, ติดตามตรวจสอบ และลบคลัสเตอร์ Ray จากอินเทอร์เฟซบนเว็บใน Amazon SageMaker Studio จากนั้นเชื่อมต่อ JupyterLab, Code Editor หรือ IDE ในเครื่องเข้ากับคลัสเตอร์ Ray ที่กำลังเรียกใช้ และดำเนินรอบการวนซ้ำแบบโต้ตอบกับการประมวลผลระดับคลัสเตอร์ คลัสเตอร์ Ray แบบหลายโหนดทำงานเสมือนสภาพแวดล้อมการพัฒนาในเครื่อง ดังนั้นคุณจึงทดสอบการเปลี่ยนแปลงแต่ละครั้งได้ทันทีโดยไม่ต้องรอให้งานใหม่เข้าคิวและเริ่มทำงาน สำหรับข้อมูลการสังเกต HyperPod จะจัดสรรแดชบอร์ด Grafana พร้อมเมตริกในบริการที่มีการจัดการของ Amazon สำหรับ Prometheus และช่วยให้เข้าถึง Ray Dashboard ได้ในคลิกเดียวผ่านลิงก์เบราว์เซอร์ที่ปลอดภัย ซึ่งช่วยให้คุณมองเห็นเวิร์กโหลดของคุณได้ตั้งแต่การเรียกใช้ครั้งแรก สำหรับการฝึกในระดับขนาดใหญ่ การกู้คืนโหนดอัตโนมัติและการตรวจจับงานค้างของ HyperPod จะจัดการข้อผิดพลาดของ GPU, งานค้าง, การพุ่งสูงของค่าความสูญเสีย และอัตราการโอนถ่ายข้อมูลที่ลดลง การสร้างจุดตรวจสอบแบบแบ่งระดับจะกู้คืนสถานะจากหน่วยความจำของคลัสเตอร์เพื่อเพิ่ม Goodput ให้สูงสุด และการกำกับดูแล Task จะปรับปรุงการใช้งานทรัพยากรการประมวลผลผ่านโควตา, ลำดับความสำคัญ และการแย่งใช้ทรัพยากร เมื่อทำงานร่วมกัน ความสามารถเหล่านี้ช่วยให้การเรียกใช้การฝึกที่ใช้เวลานานของคุณดำเนินต่อไปได้แม้เกิดความล้มเหลว และเพิ่มปริมาณงานที่มีประโยชน์ซึ่งทำได้ต่อชั่วโมง GPU ให้สูงสุด สำหรับการอนุมานด้วย Ray Serve แคช KV แบบแบ่งระดับจะนำ Prefix ที่แคชไว้กลับมาใช้ใหม่เพื่อลดระยะเวลาจนถึงโทเค็นแรก และคุณสามารถติดตั้งใช้งานโมเดล Amazon SageMaker JumpStart ได้โดยตรง
โค้ด Ray แบบโอเพนซอร์สสามารถเรียกใช้ได้โดยไม่มีการเปลี่ยนแปลง และคุณสามารถเลือกใช้ประสบการณ์ที่สร้างตามวัตถุประสงค์ใน SageMaker Studio หรือนำความสามารถแต่ละรายการไปผสานรวมเข้ากับแพลตฟอร์ม ML ของคุณเอง
การรองรับ Ray พร้อมใช้งานสำหรับคลัสเตอร์ HyperPod ที่ควบคุมระบบโดย Amazon EKS ใน AWS Region ที่รองรับ SageMaker HyperPod หากต้องการเรียนรู้เพิ่มเติม โปรดดูเอกสารประกอบ SageMaker HyperPod และสำรวจการสาธิตแบบโต้ตอบ