Amazon SageMaker HyperPod Inference Gateway für skalierbare LLM-Inferenz

Veröffentlicht am: 24. Sept. 2026

Amazon SageMaker HyperPod Inference Gateway ist ein Kubernetes-natives, GPU-fähiges Routing-System, das als einzelnes EKS-verwaltetes Add-on auf der vorhandenen SageMaker HyperPod-Infrastruktur ohne Anwendungsänderungen eingesetzt wird. Durch den Ersatz des unintelligenten Round-Robin-Load-Balancing durch Inferenzsignal-gesteuertes Routing in Echtzeit reduziert es die First-Token-Latenz um bis zu 82 % und die P99-TTFT-Reduktionen in Szenarien mit gemischter Hardware und Burst-Traffic um 97–98 %.

Das Gateway besteht aus drei Kernkomponenten. Der Envoy-Endpunkt beendet den HTTPS-Traffic und stellt einen einzelnen privaten Endpunkt pro Cluster zur Verfügung. Der Body-Based Router liest den Modellnamen direkt aus jeder eingehenden Anfrage und leitet ihn an den richtigen GPU-Pool weiter. So kann ein Gateway viele Modelle von einer einzigen Endpunkt-URL aus bedienen, ohne dass Client-seitige Änderungen erforderlich sind. Der Endpunkt-Picker bewertet kontinuierlich jeden Modellserver-Pod in Echtzeit anhand von 6 Signalen auf Inferenzebene – KV-Cache-Auslastung, Warteschlangentiefe, LoRa-Adapter-Residenz, Präfix-Cache-Trefferrate, vorhergesagte Latenz und laufende Anfragen – und wählt den optimalen Pod für jede einzelne Anfrage aus.

Das Gateway funktioniert mit jedem OpenAI-kompatiblen Modellserver, einschließlich vLLM und sGLang, und erfordert keine Änderungen des Anwendungscodes.

Routing pro Cluster ist heute in allen AWS-Regionen verfügbar, in denen das SageMaker HyperPod Inference Add-on unterstützt wird. Demnächst verfügbar – cluster- und regionsübergreifendes Routing mit zentralisiertem Flotten-Gateway, globaler Ratenbegrenzung und kostenstufenorientierter Traffic-Gestaltung.

Um mehr zu erfahren, lesen Sie den Launch-Blog und schauen Sie sich die Dokumentation an.