O Amazon SageMaker HyperPod aprimora o suporte ao Ray

Publicado: 24 de ago de 2026

O Amazon SageMaker HyperPod agora aprimora o suporte ao Ray com observabilidade integrada, treinamento resiliente, inferência acelerada e ambientes de desenvolvimento gerenciados. O Ray é uma estrutura popular de código aberto para escalar workloads de IA em uma camada de computação unificada, desde o processamento de dados e o treinamento distribuído até o aprendizado por reforço e a distribuição de modelos. Executar o Ray no Kubernetes em escala de produção pode ser um fardo operacional: problemas de trabalho, baixa utilização da GPU a partir de alocações estáticas de equipes e configuração de observabilidade em várias etapas. Além disso, a falta de um ambiente de desenvolvimento interativo significa que cada alteração de código precisa de outro envio de trabalho e familiaridade com o kubectl.

O HyperPod agora oferece desenvolvimento mais fácil, treinamento resiliente e inferência acelerada para Ray. Cientistas de dados criam, editam, monitoram e excluem clusters Ray de uma interface baseada na web no Amazon SageMaker Studio, depois anexam o JupyterLab, o Editor de Código ou um IDE local a um cluster Ray em execução e iteram interativamente com a computação em escala de cluster. Um cluster Ray de vários nós se comporta como um ambiente de desenvolvimento local, então você testa cada alteração imediatamente, sem esperar que um novo trabalho entre na fila e comece. Por questões de observabilidade, o HyperPod provisiona os painéis do Grafana com métricas no Amazon Managed Service para Prometheus e permite acesso com um clique ao Painel do Ray por meio de um link seguro do navegador, oferecendo visibilidade de suas workloads desde a primeira execução. Para treinamento em grande escala, a recuperação automática de nós do HyperPod e a detecção de trabalhos suspensos lidam com falhas na GPU, interrupções no trabalho, picos de perda e redução de throughput. O ponto de verificação hierárquico restaura o estado da memória do cluster para maximizar o rendimento, e a governança de tarefas melhora a utilização da computação por meio de cotas, prioridades e preempção. Juntos, eles mantêm seus longos treinos progredindo em meio a falhas e maximizam o trabalho útil realizado por hora de GPU. Para inferência com o Ray Serve, um cache KV em camadas reutiliza prefixos em cache para reduzir o tempo até o primeiro token, e você pode implantar modelos do Amazon SageMaker JumpStart diretamente.

O código Ray de código aberto funciona inalterado e você pode adotar a experiência específica do SageMaker Studio ou usar recursos individuais para integrá-lo à sua própria plataforma de ML.

O suporte ao Ray está disponível para clusters HyperPod orquestrados pelo Amazon EKS, nas regiões da AWS em que o SageMaker HyperPod tem suporte. Para saber mais, consulte a documentação do SageMaker HyperPod e explore a demonstração interativa.