Suy luận Amazon SageMaker AI hiện hỗ trợ phiên bản G7
Suy luận Amazon SageMaker AI hiện hỗ trợ phiên bản G7 được trang bị GPU NVIDIA RTX PRO 4500 Blackwell Server Edition, cho phép bạn triển khai các mô hình máy học với hiệu năng suy luận AI cao hơn lên đến 4,6 lần so với phiên bản G6 thế hệ trước. Khách hàng triển khai các mô hình AI tạo sinh để suy luận sản xuất cần thông lượng GPU và dung lượng bộ nhớ cao để phục vụ các mô hình trung bình đến lớn theo cách tiết kiệm chi phí, nhưng các phiên bản thế hệ trước thường yêu cầu cấp phát quá mức tài nguyên điện toán tốn kém hoặc lượng tử hóa mô hình để phù hợp với giới hạn của bộ nhớ.
Phiên bản G7 cung cấp 32 GB bộ nhớ GPU cho mỗi GPU với lõi Tensor thế hệ thứ 5, kết nối mạng hỗ trợ EFA lên đến 700 Gbps (gấp 7 lần so với G6) và dung lượng lưu trữ SSD NVMe cục bộ lên đến 7,6 TB để duy trì các mô hình lớn gần với điện toán. Những khả năng này giúp phiên bản G7 rất phù hợp để phục vụ các mô hình trong phạm vi 7 tỷ – 30 tỷ thông số, khối lượng công việc tạo hình ảnh và video, cũng như các điểm cuối suy luận đa mô hình được hưởng lợi từ băng thông và thông lượng bộ nhớ cao hơn. Bạn có thể triển khai mô hình trên phiên bản G7 bằng bảng điều khiển, API hoặc SDK Suy luận SageMaker AI bằng cách chỉ định các loại phiên bản G7 (chẳng hạn như ml.g7.xlarge đến ml.g7.48xlarge) trong cấu hình điểm cuối của bạn.
Phiên bản G7 cho suy luận SageMaker AI có sẵn ở Miền Đông Hoa Kỳ (Bắc Virginia, Ohio) và Miền Tây Hoa Kỳ (Oregon). Vui lòng truy cập trang định giá của chúng tôi để biết thông tin về mức giá của những phiên bản này.