Amazon SageMaker HyperPod mejora la compatibilidad con Ray
Amazon SageMaker HyperPod ahora mejora la compatibilidad con Ray con entornos integrados de observabilidad, entrenamiento resiliente, inferencia acelerada y desarrollo gestionado. Ray es un popular marco de código abierto para escalar las cargas de trabajo de IA en una capa de computación unificada, desde el procesamiento de datos y la capacitación distribuida hasta el aprendizaje por refuerzo y el servicio de modelos. La ejecución de Ray en Kubernetes a escala de producción puede ser una carga operativa: los trabajos se interrumpen, el bajo uso de la GPU debido a las asignaciones de equipos estáticos y la configuración de observabilidad en varios pasos. Además, la falta de un entorno de desarrollo interactivo significa que cada cambio de código requiere otro envío de trabajo y familiaridad con kubectl.
HyperPod ahora ofrece a Ray un desarrollo más sencillo, un entrenamiento resiliente y una inferencia acelerada. Los científicos de datos crean, editan, supervisan y eliminan clústeres de Ray desde una interfaz basada en web en Amazon SageMaker Studio y, a continuación, adjuntan JupyterLab, un editor de código o un IDE local a un clúster de Ray en ejecución e iteran de forma interactiva contra el procesamiento a escala de clúster. Un clúster Ray multinodo se comporta como un entorno de desarrollo local, por lo que puede probar cada cambio de forma inmediata, sin esperar a que un nuevo trabajo entre en la cola y se inicie. Para la observabilidad, HyperPod aprovisiona los paneles de Grafana con métricas en Amazon Managed Service para Prometheus y permite el acceso con un solo clic al panel de control de Ray a través de un enlace de navegador seguro, lo que le brinda visibilidad de sus cargas de trabajo desde la primera ejecución. Para el entrenamiento a gran escala, la recuperación automática de los nodos HyperPod y la detección de trabajos bloqueados gestionan los fallos de la GPU, los bloqueos de tareas, los picos de pérdidas y la degradación del rendimiento. Los puntos de control por niveles restauran el estado de la memoria del clúster para maximizar el rendimiento, y la gobernanza de tareas mejora la utilización de la computación mediante cuotas, prioridades y preferencia. En conjunto, permiten que sus largas sesiones de entrenamiento progresen a pesar de los fracasos y maximizan el trabajo útil realizado por hora de GPU. Para hacer inferencias con Ray Serve, una caché KV por niveles reutiliza los prefijos almacenados en caché para reducir el tiempo hasta el primer token, y puede implementar los modelos de Amazon SageMaker JumpStart directamente.
El código Ray de código abierto se ejecuta sin cambios y puede adoptar la experiencia diseñada específicamente en SageMaker Studio o aprovechar las capacidades individuales para integrarlas en su propia plataforma de aprendizaje automático.
La compatibilidad con Ray está disponible para los clústeres de HyperPod orquestados por Amazon EKS en las regiones de AWS en las que se admite SageMaker HyperPod. Para obtener más información, consulte la documentación de SageMaker HyperPod y explore la demostración interactiva.