Amazon SageMaker AI 推論現已支援 G7 執行個體
Amazon SageMaker AI 推論現已支援採用 NVIDIA RTX PRO 4500 Blackwell Server Edition GPU 的 G7 執行個體,讓您能部署機器學習模型,與前一代 G6 執行個體相比,AI 推論效能最高可提升 4.6 倍。部署用於生產推論之生成式 AI 模型的客戶,需要高 GPU 輸送量和記憶體容量,才能以符合成本效益的方式服務中大型模型;但前一代執行個體通常需要過度佈建昂貴的運算資源,或量化模型以符合記憶體限制。
G7 執行個體每個 GPU 配備 32 GB GPU 記憶體和第 5 代 Tensor Core、最高 700 Gbps 的 EFA 啟用網路 (相較於 G6 提升 7 倍),以及最高 7.6 TB 的本機 NVMe SSD 儲存,可讓大型模型更接近運算資源。這些功能讓 G7 執行個體非常適合用於服務參數範圍介於 7B–30B 的模型、影像和影片生成工作負載,以及受益於更高記憶體頻寬和輸送量的多模型推論端點。您可以在端點組態中指定 G7 執行個體類型 (例如 ml.g7.xlarge 至 ml.g7.48xlarge),透過 SageMaker AI Inference 主控台、API 或 SDK 在 G7 執行個體上部署模型。
適用於 SageMaker AI 推論的 G7 執行個體現已在美國東部 (維吉尼亞北部、俄亥俄) 和美國西部 (奧勒岡) 提供。如需這些執行個體的定價資訊,請瀏覽我們的定價頁面。