Amazon SageMaker HyperPod Inference Gateway でスケーラブルな LLM 推論を実現
Amazon SageMaker HyperPod Inference Gateway は、Kubernetes ネイティブで GPU を認識するルーティングシステムです。既存の SageMaker HyperPod インフラストラクチャに単一の EKS マネージドアドオンとしてデプロイでき、アプリケーションを変更する必要はありません。単純なラウンドロビン方式のロードバランシングに代えて、リアルタイムの推論シグナルに基づくルーティングを採用することで、最初のトークンが返されるまでのレイテンシーを最大 82% 短縮します。また、異なるハードウェアが混在するシナリオやバーストトラフィックが発生するシナリオでは、p99 TTFT を 97~98% 短縮します。
このゲートウェイは、3 つの主要コンポーネントで構成されています。Envoy Endpoint は HTTPS トラフィックを終端し、クラスターごとに単一のプライベートエンドポイントを公開します。Body-Based Router は、受信した各リクエストから直接モデル名を読み取り、適切な GPU プールにルーティングします。これにより、クライアント側を変更することなく、1 つのゲートウェイで単一のエンドポイント URL から多数のモデルを提供できます。Endpoint Picker は、KV キャッシュ使用率、キューの深さ、LoRA アダプターの常駐状況、プレフィックスのキャッシュヒットレート、予測レイテンシー、実行中のリクエスト数という 6 つの推論レベルのシグナルに基づいて、すべてのモデルサーバーポッドをリアルタイムで継続的にスコアリングし、個々のリクエストに最適なポッドを選択します。
このゲートウェイは、vLLM や SGLang をはじめとする OpenAI 互換のあらゆるモデルサーバーで動作し、アプリケーションコードを変更する必要はありません。
クラスターごとのルーティングは、SageMaker HyperPod 推論アドオンがサポートされているすべての AWS リージョンで本日より利用できます。今後、一元化されたフリートゲートウェイによるクラスター間およびリージョン間のルーティング、グローバルなレート制限、コスト階層に応じたトラフィックシェーピングにも対応する予定です。