Amazon SageMaker HyperPod รองรับการแคชโมเดลแล้ว ซึ่งช่วยให้การปรับขนาดการอนุมานอัตโนมัติรวดเร็วยิ่งขึ้น และลดปัญหา Cold Start
ขณะนี้ Amazon SageMaker HyperPod รองรับการแคชโมเดลแล้ว ซึ่งเป็นการเพิ่มประสิทธิภาพการอนุมานที่โหลดน้ำหนักโมเดลและอิมเมจคอนเทนเนอร์ล่วงหน้าไปยังโหนดคลัสเตอร์ ทำให้พ็อดเริ่มต้นได้ในเวลาเพียงไม่กี่วินาที แทนที่จะเป็นหลายนาที
เมื่อเรียกใช้การอนุมาน LLM ในขนาดใหญ่สำหรับเวิร์กโหลดต่างๆ เช่น ผู้ช่วยแชท ไปป์ไลน์แบบ Agentic, RAG และการวิเคราะห์เอกสาร Cold Start ถือเป็นปัญหาคอขวดอย่างแท้จริง การนำไปใช้จริงและการปรับขยายใช้เวลาส่วนใหญ่ไปกับการดาวน์โหลดอิมเมจคอนเทนเนอร์และน้ำหนักของโมเดล ปัญหานี้จะยิ่งทวีความรุนแรงขึ้นเมื่อขนาดของโมเดลใหญ่ขึ้น โดยโมเดลขนาดใหญ่อาจต้องใช้เวลาหลายสิบนาทีกว่าที่จะพร้อมรองรับปริมาณการรับส่งข้อมูลได้
การแคชโมเดลช่วยแก้ปัญหานี้ด้วยความสามารถอิสระสองประการ ระบบแคชสำหรับค่าน้ำหนักจะจัดเก็บค่าน้ำหนักของโมเดลไว้บน NVMe ภายในเครื่อง ทำให้พ็อดสามารถอ่านข้อมูลจากพื้นที่จัดเก็บข้อมูลภายในเครื่องที่มีความเร็วสูงได้ แทนที่จะต้องดึงข้อมูลผ่านเครือข่ายจาก S3 หรือ FSx แคชอิมเมจจะดึงอิมเมจคอนเทนเนอร์มาเตรียมไว้ล่วงหน้า ทำให้พ็อดไม่จำเป็นต้องดาวน์โหลดจาก ECR เลย หากพ็อดไปลงที่โหนดซึ่งไม่มีการ Warm Cache ระบบจะเปลี่ยนไปดึงข้อมูลจากแหล่งต้นทางโดยอัตโนมัติ จึงไม่มีความเสี่ยงที่พ็อดจะค้างหรือทำงานล้มเหลว
ผลการทดสอบประสิทธิภาพของโมเดลขนาดตั้งแต่ 57 GB ถึง 145 GB แสดงให้เห็นว่าการปรับขยายทำงานได้เร็วขึ้นประมาณ 60% และแคชอิมเมจช่วยลดเวลาในการดึงอิมเมจลงได้มากกว่า 2 นาที (ลดลงถึง 97%) ประโยชน์ที่ได้รับจะเพิ่มขึ้นตามขนาดของโมเดล ในขณะที่ยังคงรักษาความเสถียรของเส้นทางของต้นทางเดิมไว้ได้
ลูกค้าสามารถเปิดใช้งานการแคชโมเดลผ่าน HyperPod Inference Operator ได้โดยการเพิ่มส่วน modelCacheConfig ลงในทรัพยากร InferenceEndpointConfig หรือ JumpStartModel ของตน Operator จัดการวงจรการทำงานทั้งหมดโดยไม่ต้องมีการตั้งค่าหรือการล้างข้อมูลด้วยตนเอง
ขณะนี้ การแคชโมเดลเปิดให้ใช้งานทั่วไปแล้วในรีเจี้ยนทุกแห่งที่มี SageMaker HyperPod ให้บริการ ในการเริ่มต้น โปรดดูเอกสารประกอบ SageMaker HyperPod