Amazon SageMaker HyperPod расширяет поддержку Ray

Проведено: 24 авг. 2026 г.

Amazon SageMaker HyperPod расширяет поддержку Ray за счет встроенных средств наблюдаемости, отказоустойчивого обучения, ускоренного вывода и управляемых сред разработки. Ray – это популярная платформа с открытым исходным кодом для масштабирования рабочих нагрузок ИИ на унифицированном вычислительном уровне: от обработки данных и распределенного обучения до обучения с подкреплением и обслуживания моделей. Запуск Ray на Kubernetes в производственном масштабе может быть сопряжен с эксплуатационными сложностями: зависанием заданий, низкой загрузкой GPU из-за статического распределения команд и многоэтапной настройкой наблюдаемости. Кроме того, отсутствие интерактивной среды разработки означает, что каждое изменение кода требует повторной отправки задания и знакомства с kubectl.

HyperPod теперь упрощает разработку, обеспечивает надежное обучение и ускоренный вывод в Ray. Специалисты по работе с данными создают, редактируют, отслеживают и удаляют кластеры Ray в веб-интерфейсе Студии Amazon SageMaker, а затем подключают JupyterLab, Редактор кода или локальную IDE к работающему кластеру Ray и выполняют интерактивные итерации на основе вычислительных ресурсов в масштабе кластера. Многоузловой кластер Ray работает как локальная среда разработки, поэтому каждое изменение тестируется немедленно, не дожидаясь постановки в очередь и запуска нового задания. Для обеспечения наблюдаемости HyperPod предоставляет панели управления Grafana с метриками в Управляемом сервисе Amazon для Prometheus и обеспечивает доступ к панели управления Ray одним щелчком мыши по защищенной ссылке в браузере, что позволяет наблюдать за рабочими нагрузками с первого запуска. При масштабном обучении функции автоматического восстановления узлов HyperPod и обнаружения зависших заданий позволяют обрабатывать сбои GPU, зависания заданий, всплески потерь и снижение пропускной способности. Многоуровневая система контрольных точек восстанавливает состояние из памяти кластера, обеспечивая максимальную полезную пропускную способность, а управление задачами повышает эффективность использования вычислительных ресурсов благодаря квотам, приоритетам и упреждению. В совокупности эти возможности позволяют выполнять длительные сеансы обучения без сбоев и делать максимум полезной работы за час работы GPU. Для вывода с помощью Ray Serve многоуровневый кэш KV повторно использует кэшированные префиксы, чтобы сократить время получения первого токена. Кроме того, модели Amazon SageMaker JumpStart можно развертывать напрямую.

Открытый код Ray является неизменным, и вы можете либо использовать специально разработанный интерфейс в Студии SageMaker, либо интегрировать отдельные возможности в собственную платформу машинного обучения.

Поддержка Ray доступна для кластеров HyperPod с оркестрацией Amazon EKS во всех регионах AWS, где поддерживается SageMaker HyperPod. Подробнее см. в документации SageMaker HyperPod и в интерактивной демонстрации.