Amazon SageMaker HyperPod tăng cường hỗ trợ cho Ray
Amazon SageMaker HyperPod hiện tăng cường hỗ trợ cho Ray với khả năng quan sát nội trạng được tích hợp sẵn, đào tạo có khả năng phục hồi, suy luận tăng tốc và môi trường phát triển được quản lý. Ray là một khung nguồn mở phổ biến để điều chỉnh quy mô khối lượng công việc AI trên một lớp điện toán hợp nhất, từ xử lý dữ liệu và đào tạo phân tán đến học tăng cường và phục vụ mô hình. Chạy Ray trên Kubernetes ở quy mô sản xuất có thể là một gánh nặng vận hành: công việc bị treo, sử dụng GPU thấp do phân bổ nhóm tĩnh và thiết lập khả năng quan sát nội trạng nhiều bước. Ngoài ra, việc thiếu môi trường phát triển tương tác có nghĩa là mọi thay đổi mã đều cần phải gửi lại công việc và phải quen thuộc với kubectl.
HyperPod giờ đây mang lại khả năng phát triển dễ dàng hơn, đào tạo có khả năng phục hồi và suy luận tăng tốc cho Ray. Các nhà khoa học dữ liệu tạo, chỉnh sửa, giám sát và xóa các cụm Ray khỏi giao diện dựa trên web trong Studio Amazon SageMaker, sau đó đính kèm JupyterLab, Trình biên soạn mã hoặc IDE cục bộ vào cụm Ray đang chạy và lặp lại tương tác dựa theo điện toán quy mô cụm. Một cụm Ray đa nút hoạt động giống như một môi trường phát triển cục bộ, vì vậy bạn kiểm thử từng thay đổi ngay lập tức mà không cần chờ đợi một công việc mới được đưa vào hàng chờ và bắt đầu. Đối với Khả năng quan sát nội trạng, HyperPod cấp phát bảng điều khiển Grafana với các chỉ số trong Dịch vụ được quản lý của Amazon dành cho Prometheus và cho phép truy cập bằng một cú nhấp chuột vào Bảng điều khiển Ray thông qua liên kết trình duyệt an toàn, giúp bạn có khả năng hiển thị khối lượng công việc của mình ngay từ lần chạy đầu tiên. Đối với đào tạo trên quy mô lớn, tính năng tự động phục hồi nút HyperPod và phát hiện công việc bị treo sẽ xử lý các lỗi GPU, công việc bị treo, đột biến tổn thất và thông lượng bị suy giảm. Lưu điểm kiểm tra phân bậc khôi phục trạng thái từ bộ nhớ cụm để tối đa hóa thông lượng hữu ích và quản trị nhiệm vụ cải thiện mức sử dụng điện toán thông qua hạn mức, ưu tiên và giành chỗ. Những yếu tố này kết hợp lại giúp các lượt chạy đào tạo kéo dài của bạn tiến triển qua các lỗi và tối đa hóa công việc hữu ích được thực hiện trên mỗi giờ GPU. Để suy luận với Ray Serve, bộ đệm KV được phân bậc sử dụng lại các tiền tố được lưu đệm để giảm thời gian đến mã thông báo đầu tiên và bạn có thể triển khai trực tiếp các mô hình Amazon SageMaker JumpStart.
Mã nguồn mở Ray chạy không thay đổi và bạn có thể áp dụng trải nghiệm chuyên dụng trong Studio SageMaker hoặc sử dụng các khả năng riêng lẻ để tích hợp vào nền tảng ML của riêng bạn.
Hỗ trợ Ray có sẵn cho các cụm HyperPod do Amazon EKS điều phối ở các Khu vực AWS hỗ trợ SageMaker HyperPod. Để tìm hiểu thêm, hãy xem tài liệu về SageMaker HyperPod và khám phá phần minh họa tương tác.