Amazon SageMaker HyperPod Inference Gateway สำหรับการอนุมาน LLM ที่ปรับขนาดได้

โพสต์บน: 24 ก.ย. 2026

Amazon SageMaker HyperPod Inference Gateway เป็นระบบกำหนดเส้นทางที่ทำงานแบบเนทีฟบน Kubernetes และรองรับการทำงานร่วมกับ GPU โดยสามารถติดตั้งเป็นส่วนเสริมของ EKS แบบเดี่ยวที่มีการจัดการสำหรับโครงสร้างพื้นฐาน SageMaker HyperPod ที่มีอยู่เดิมได้ทันที โดยไม่จำเป็นต้องปรับแก้โค้ดของแอปพลิเคชันแต่อย่างใด การเปลี่ยนจากการกระจายโหลดแบบ round-robin ที่ไม่ชาญฉลาด มาเป็นการกำหนดเส้นทางที่ขับเคลื่อนด้วยสัญญาณการอนุมานแบบเรียลไทม์ ช่วยลดเวลาแฝงในการสร้างโทเค็นแรกได้สูงสุดถึง 82% และลดค่า p99 ของ TTFT ลงได้ 97–98% ในสถานการณ์ที่มีการใช้งานฮาร์ดแวร์หลากหลายรูปแบบและมีปริมาณการรับส่งข้อมูลแบบพุ่งสูงขึ้นอย่างรวดเร็ว

เกตเวย์ถูกสร้างขึ้นโดยอาศัยองค์ประกอบหลัก 3 ประการ Envoy Endpoint ทำหน้าที่ยุติการรับส่งข้อมูล HTTPS และเปิดให้บริการตำแหน่งข้อมูลส่วนตัวเพียงจุดเดียวต่อหนึ่งคลัสเตอร์ Body-Based Router จะอ่านชื่อโมเดลโดยตรงจากคำขอที่เข้ามา แล้วส่งคำขอนั้นไปยังกลุ่ม GPU ที่เหมาะสม ซึ่งช่วยให้เกตเวย์เพียงจุดเดียวสามารถรองรับโมเดลจำนวนมากผ่าน URL ตำแหน่งข้อมูลเดียวกันได้ โดยที่ฝั่งไคลเอ็นต์ไม่จำเป็นต้องปรับเปลี่ยนการตั้งค่าใดๆ Endpoint Picker จะประเมินคะแนนของพ็อดเซิร์ฟเวอร์โมเดลแต่ละรายการอย่างต่อเนื่องแบบเรียลไทม์ โดยพิจารณาจากสัญญาณระดับการอนุมาน 6 ประการ ได้แก่ การใช้งานแคช KV ความลึกของคิว การคงอยู่ของอะแดปเตอร์ LoRA อัตราการพบข้อมูลในแคชคำนำหน้า เวลาแฝงที่คาดการณ์ไว้ และจำนวนคำขอที่กำลังทำงานอยู่ เพื่อเลือกพ็อดที่เหมาะสมที่สุดสำหรับแต่ละคำขอ

เกตเวย์นี้สามารถทำงานร่วมกับเซิร์ฟเวอร์โมเดลที่รองรับ OpenAI ได้ทุกตัว รวมถึง vLLM และ SGLang โดยไม่จำเป็นต้องแก้ไขโค้ดของแอปพลิเคชันแต่อย่างใด

ขณะนี้ฟีเจอร์การกำหนดเส้นทางแบบต่อคลัสเตอร์พร้อมใช้งานแล้วใน AWS Region ทุกแห่งที่รองรับส่วนเสริม SageMaker HyperPod inference เตรียมพบกับฟีเจอร์ใหม่: การกำหนดเส้นทางข้ามคลัสเตอร์และข้ามรีเจี้ยนด้วยเกตเวย์กลุ่มอินสแตนซ์แบบรวมศูนย์ การจำกัดอัตราการใช้งานทั่วทั้งระบบ และการจัดการปริมาณการรับส่งข้อมูลโดยคำนึงถึงระดับต้นทุน

หากต้องการเรียนรู้เพิ่มเติม โปรดอ่านบล็อกการเปิดตัวและดูที่เอกสารประกอบ