Amazon SageMaker HyperPod Inference Gateway 可擴展 LLM 推論

張貼日期: 2026年9月24日

Amazon SageMaker HyperPod Inference Gateway 是 Kubernetes 原生、具備 GPU 感知能力的路由系統,可做為單一 EKS 受管附加元件部署在現有的 SageMaker HyperPod 基礎結構上,且無須變更任何應用程式。透過以即時推論訊號驅動的路由取代不智慧的輪詢負載平衡,它可在混合硬體和暴增流量情境中,將首個字符延遲降低多達 82%,並將 p99 TTFT 降低 97–98%。

此閘道是圍繞 3 個核心元件所建構。Envoy Endpoint 會終止 HTTPS 流量,並為每個叢集公開單一私有端點。Body-Based Router 會直接從每個傳入請求讀取模型名稱,並將其路由至正確的 GPU 集區 - 讓單一閘道可從單一端點 URL 服務多個模型,且無須進行任何用戶端變更。Endpoint Picker 會持續即時根據 6 個推論層級訊號為每個模型伺服器 Pod 評分 - KV 快取使用率、佇列深度、LoRA 配接器常駐狀態、前置字元快取命中率、預測延遲和執行中的請求 - 為每個個別請求選取最佳 Pod。

此閘道可與任何 OpenAI 相容的模型伺服器搭配運作,包括 vLLM 和 SGLang,且無須變更任何應用程式碼。

各叢集路由現已在所有支援 SageMaker HyperPod 推論附加元件的 AWS 區域中提供。即將推出 - 透過集中式機群閘道進行跨叢集和跨區域路由、全域速率限制,以及成本層感知的流量塑形。

若要深入了解,請閱讀發佈部落格並瀏覽文件