Amazon SageMaker HyperPod Inference Gateway para inferência de LLM escalável
O Amazon SageMaker HyperPod Inference Gateway é um sistema de roteamento nativo do Kubernetes com reconhecimento de GPU que é implantado como um único complemento gerenciado por EKS na infraestrutura existente do SageMaker HyperPod sem nenhuma alteração no aplicativo. Ao substituir o balanceamento de carga alternativo não inteligente pelo roteamento orientado por sinal de inferência em tempo real, ele reduz a latência do primeiro token em até 82% e reduções de TTFT de p99 de 97 a 98% em cenários de hardware misto e tráfego intermitente.
O Gateway é construído em torno de três componentes principais. O Envoy Endpoint encerra o tráfego HTTPS e expõe um único endpoint privado por cluster. O roteador baseado no corpo lê o nome do modelo diretamente de cada solicitação recebida e o encaminha para o pool de GPU correto, permitindo que um gateway atenda a vários modelos a partir de um único URL de endpoint sem a necessidade de alterações no lado do cliente. O Endpoint Picker pontua continuamente cada pod de servidor modelo em tempo real em seis sinais de nível de inferência - utilização do cache KV, profundidade da fila, residência do adaptador LoRA, taxa de acertos do cache de prefixo, latência prevista e solicitações em execução - selecionando o pod ideal para cada solicitação individual.
O gateway funciona com qualquer servidor modelo compatível com OpenAI, incluindo vLLm e SGlang, sem exigir alterações no código do aplicativo.
O roteamento por cluster está disponível hoje em todas as regiões da AWS nas quais o complemento de inferência SageMaker HyperPod tem suporte. Em breve: roteamento entre clusters e regiões com um gateway de frota centralizado, limitação de taxas globais e modelagem de tráfego com reconhecimento de custos.
Para saber mais, leia o blog de lançamento e explore a documentação