Amazon SageMaker HyperPod 強化 Ray 支援
Amazon SageMaker HyperPod 現在透過內建可觀測性、復原式培訓、加速推論和受管開發環境,強化對 Ray 的支援。Ray 是廣受歡迎的開放原始碼架構,可在統一的運算層上擴展 AI 工作負載,涵蓋從資料處理和分散式培訓到強化學習及模型服務。在生產規模的 Kubernetes 上執行 Ray 可能造成營運負擔:任務無回應、靜態團隊配置導致 GPU 使用率偏低,以及多步驟的可觀測性設定。此外,缺乏互動式開發環境,意味著每次程式碼變更都需要重新提交任務,並且熟悉 kubectl。
HyperPod 現在為 Ray 帶來更簡易的開發、復原式培訓和加速推論。資料科學家可從 Amazon SageMaker Studio 的網路介面建立、編輯、監控及刪除 Ray 叢集,然後將 JupyterLab、程式碼編輯器或本機 IDE 連接至執行中的 Ray 叢集,並以互動方式使用叢集規模的運算資源進行反覆開發。多節點 Ray 叢集的行為就像本機開發環境,因此您可以立即測試每項變更,不必等待新任務排入佇列並開始執行。在可觀測性方面,HyperPod 會在 Amazon Managed Service for Prometheus 中佈建包含指標的 Grafana 儀表板,並透過安全的瀏覽器連結提供一鍵存取 Ray 儀表板的功能,讓您從首次執行起就能掌握工作負載的狀態。針對大規模培訓,HyperPod 的節點自動復原和停滯任務偵測功能可處理 GPU 故障、任務停滯、損失峰值及輸送量降低問題。分層檢查點功能會從叢集記憶體還原狀態,以最大化有效輸送量;任務治理則透過配額、優先順序和搶先處理提升運算資源使用率。這些功能共同確保您的長時間培訓執行在發生故障時仍能持續進行,並最大化每個 GPU 小時所完成的有效工作。針對使用 Ray Serve 的推論,分層 KV 快取會重複使用已快取的前綴,以縮短取得第一個字符的時間;您也可以直接部署 Amazon SageMaker JumpStart 模型。
開放原始碼 Ray 程式碼無需變更即可執行;您可以採用 SageMaker Studio 中專為此打造的體驗,或擷取個別功能並整合至您自己的 ML 平台。
Ray 支援適用於由 Amazon EKS 協調的 HyperPod 叢集,且僅限 SageMaker HyperPod 支援的 AWS 區域。如需進一步了解,請參閱 SageMaker HyperPod 文件,並探索互動式示範。