Passerelle d’inférence Amazon SageMaker HyperPod pour une inférence LLM évolutive

Publié le: 24 sept. 2026

La passerelle d’inférence Amazon SageMaker HyperPod est un système de routage natif de Kubernetes, compatible GPU, qui se déploie en tant que module complémentaire géré par EKS sur l’infrastructure SageMaker HyperPod existante sans aucune modification d’application. En remplaçant l’équilibrage de charge à tour de rôle peu intelligent par un routage piloté par des signaux d’inférence en temps réel, il réduit la latence du premier jeton jusqu’à 82 % et réduit le TTFT p99 de 97 à 98 % dans les scénarios de matériel mixte et de trafic en rafale.

La passerelle est construite autour de 3 composants principaux. Le point de terminaison Envoy met fin au trafic HTTPS et expose un seul point de terminaison privé par cluster. Le routeur Body-Based lit le nom du modèle directement à partir de chaque demande entrante et l’achemine vers le groupe de GPU approprié, ce qui permet à une passerelle de servir de nombreux modèles à partir d’une URL de point de terminaison unique sans aucune modification côté client. Le sélecteur de point de terminaison évalue en permanence chaque pod de serveur modèle en temps réel sur la base de 6 signaux de niveau d’inférence (utilisation du cache KV, profondeur de la file d’attente, résidence de l’adaptateur LoRA, taux d’accès au cache de préfixe, latence prévue et requêtes en cours d’exécution) en sélectionnant le pod optimal pour chaque demande individuelle.

La passerelle fonctionne avec n’importe quel serveur modèle compatible avec OpenAI, y compris vLLM et SGLang, sans nécessiter de modification du code d’application.

Le routage par cluster est disponible aujourd’hui dans toutes les Régions AWS où le module complémentaire d’inférence SageMaker HyperPod est pris en charge. Prochainement : routage entre clusters et entre régions avec une passerelle de flotte centralisée, une limitation globale du débit et une gestion du trafic tenant compte des coûts.

Pour en savoir plus, consultez le blog de lancement et explorez la documentation