Gateway di inferenza di Amazon SageMaker HyperPod per l'inferenza LLM scalabile

Inserito il: 24 set 2026

Il gateway di inferenza di Amazon SageMaker HyperPod è un sistema di routing nativo di Kubernetes e compatibile con le GPU che viene distribuito come singolo componente aggiuntivo gestito da EKS sull'infrastruttura SageMaker HyperPod esistente senza alcuna modifica alle applicazioni. Sostituendo il bilanciamento del carico round-robin non intelligente con un routing basato su segnali di inferenza in tempo reale, riduce la latenza del primo token fino all'82% e ottiene riduzioni del TTFT p99 del 97-98% in scenari di hardware misto e traffico burst.

Il gateway è strutturato attorno a 3 componenti principali. L'endpoint Envoy gestisce la terminazione del traffico HTTPS ed espone un singolo endpoint privato per cluster. Il Body-Based Router legge il nome del modello direttamente da ogni richiesta in arrivo e lo indirizza al pool di GPU corretto, consentendo a un singolo gateway di servire molti modelli da un unico URL di endpoint senza richiedere modifiche lato client. L'Endpoint Picker valuta continuamente ogni pod del server di modelli in tempo reale in base a 6 segnali a livello di inferenza: utilizzo della cache KV, profondità della coda, residenza dell'adattatore LoRA, percentuale di riscontro nella cache dei prefissi, latenza prevista e richieste in esecuzione, selezionando il pod ottimale per ogni singola richiesta.

Il gateway funziona con qualsiasi server di modelli compatibile con OpenAI, inclusi vLLM e SGLang, senza richiedere modifiche al codice dell'applicazione.

Il routing per cluster è disponibile oggi in tutte le regioni AWS in cui è supportato il componente aggiuntivo di inferenza SageMaker HyperPod. Disponibile a breve: routing intercluster e interregionale con un gateway di parco centralizzato, limitazione di frequenza globale e gestione del traffico basata sui livelli di costo.

Per saperne di più, leggi il blog di lancio ed esplora la documentazione