Amazon SageMaker HyperPod Inference Gateway untuk inferensi LLM yang dapat diskalakan
Amazon SageMaker HyperPod Inference Gateway adalah sistem perutean berbasis Kubernetes yang sadar GPU, yang dapat diimplementasikan sebagai tambahan terkelola EKS tunggal pada infrastruktur SageMaker HyperPod yang sudah ada tanpa perubahan aplikasi apa pun. Dengan mengganti penyeimbangan beban round-robin yang tidak cerdas dengan perutean berbasis sinyal inferensi real-time, hal ini mengurangi latensi token pertama hingga 82% dan pengurangan TTFT p99 sebesar 97–98% dalam skenario lalu lintas perangkat keras campuran dan lalu lintas burst.
Gateway ini dibangun berdasarkan 3 komponen inti. Envoy Endpoint mengakhiri lalu lintas HTTPS dan mengekspos satu titik akhir privat per klaster. Body-Based Router membaca nama model langsung dari setiap permintaan yang masuk dan mengarahkannya ke kumpulan GPU yang tepat - memungkinkan satu gateway untuk melayani banyak model dari satu URL titik akhir tanpa perlu perubahan di sisi klien. Endpoint Picker terus-menerus memberi skor pada setiap pod server model secara real time berdasarkan 6 sinyal tingkat inferensi - pemanfaatan cache KV, kedalaman antrean, residensi adaptor LoRA, laju hit cache prefiks, latensi yang diprediksi, dan permintaan yang sedang berjalan - memilih pod optimal untuk setiap permintaan individual.
Gateway ini dapat digunakan dengan server model apa pun yang kompatibel dengan OpenAI, termasuk vLLM dan SGLang, tanpa memerlukan perubahan pada kode aplikasi.
Perutean per klaster kini tersedia di semua AWS Region yang mendukung tambahan inferensi SageMaker HyperPod. Segera hadir - perutean lintas klaster dan lintas region dengan gateway armada terpusat, pembatasan laju global, dan pembentukan lalu lintas yang mempertimbangkan tingkat biaya.
Untuk mengetahui lebih lanjut, baca blog peluncuran dan jelajahi dokumentasi