Amazon SageMaker HyperPod meningkatkan dukungan untuk Ray

Dikirim di: 24 Agt 2026

Amazon SageMaker HyperPod kini meningkatkan dukungan untuk Ray dengan fitur observabilitas bawaan, pelatihan yang tangguh, inferensi yang dipercepat, dan lingkungan pengembangan yang terkelola. Ray adalah kerangka kerja sumber terbuka populer untuk meningkatkan skala beban kerja AI pada lapisan komputasi terpadu, mulai dari pemrosesan data dan pelatihan terdistribusi hingga pembelajaran penguatan dan penyajian model. Menjalankan Ray di Kubernetes pada skala produksi dapat menjadi beban operasional: pekerjaan macet, pemanfaatan GPU rendah karena alokasi tim statis, dan pengaturan observabilitas multi-langkah. Selain itu, kurangnya lingkungan pengembangan interaktif berarti setiap perubahan kode memerlukan pengajuan pekerjaan lain dan pemahaman tentang kubectl.

HyperPod kini menghadirkan pengembangan yang lebih mudah, pelatihan yang tangguh, dan inferensi yang dipercepat bagi Ray. Ilmuwan data membuat, mengedit, memantau, dan menghapus klaster Ray dari antarmuka berbasis web di Amazon SageMaker Studio, lalu melampirkan JupyterLab, Editor Kode, atau IDE lokal ke klaster Ray yang sedang berjalan dan melakukan iterasi secara interaktif terhadap komputasi skala klaster. Klaster Ray multi-simpul berperilaku layaknya lingkungan pengembangan lokal, sehingga Anda dapat segera menguji setiap perubahan tanpa harus menunggu pekerjaan baru masuk antrean dan dimulai. Untuk Observabilitas, HyperPod menyediakan dasbor Grafana dengan metrik di Amazon Managed Service for Prometheus dan memungkinkan akses sekali klik ke Dasbor Ray melalui tautan browser yang aman, memberi Anda visibilitas ke dalam beban kerja Anda sejak pertama kali dijalankan. Untuk pelatihan dalam skala, pemulihan otomatis simpul HyperPod dan deteksi pekerjaan yang macet menangani kesalahan GPU, pekerjaan yang macet, lonjakan kehilangan data, dan penurunan throughput. Pos pemeriksaan bertingkat memulihkan status dari memori klaster untuk memaksimalkan goodput, dan tata kelola tugas meningkatkan pemanfaatan komputasi melalui kuota, prioritas, dan preemption. Secara bersama-sama, hal-hal ini menjaga agar sesi pelatihan yang panjang tetap berjalan meskipun terjadi kegagalan, serta memaksimalkan hasil kerja yang bermanfaat per jam-GPU. Untuk inferensi dengan Ray Serve, cache KV bertingkat menggunakan kembali prefiks yang di-cache untuk mengurangi waktu hingga token pertama, dan Anda dapat menerapkan model Amazon SageMaker JumpStart secara langsung.

Kode Ray sumber terbuka dapat dijalankan tanpa perubahan, dan Anda dapat memilih untuk menggunakan pengalaman yang dirancang khusus di SageMaker Studio atau mengambil kapabilitas individual untuk diintegrasikan ke dalam platform ML Anda sendiri.

Dukungan Ray tersedia untuk klaster HyperPod yang diorkestrasi oleh Amazon EKS, di AWS Region tempat SageMaker HyperPod didukung. Untuk mempelajari lebih lanjut, lihat dokumentasi SageMaker HyperPod, dan jelajahi demo interaktif.