Amazon SageMaker AI Inference, 이제 G7 인스턴스 지원

게시된 날짜: 2026년 7월 22일

Amazon SageMaker AI Inference는 이제 NVIDIA RTX PRO 4500 Blackwell Server Edition GPU로 구동되는 G7 인스턴스를 지원하므로 이전 세대 G6 인스턴스에 비해 최대 4.6배의 AI 추론 성능을 갖춘 기계 학습 모델을 배포할 수 있습니다. 프로덕션 추론을 위해 생성형 AI 모델을 배포하는 고객은 중대형 모델을 비용 효율적으로 처리하기 위해 높은 GPU 처리량과 메모리 용량을 필요로 하지만 이전 세대 인스턴스에서는 값비싼 컴퓨팅을 과잉 프로비저닝하거나 메모리 제약에 맞게 모델을 양자화해야 하는 경우가 많았습니다.

G7 인스턴스는 5세대 Tensor Core를 통해 GPU당 32GB의 GPU 메모리, 최대 700Gbps의 EFA 지원 네트워킹(G6에 비해 7배), 대형 모델을 컴퓨팅 환경에 가깝게 유지하기 위한 최대 7.6TB의 로컬 NVMe SSD 스토리지를 제공합니다. 이러한 기능 덕분에 G7 인스턴스는 7B~30B 파라미터 범위의 모델, 이미지 및 동영상 생성 워크로드, 메모리 대역폭과 처리량이 더 높은 경우 이점을 누릴 수 있는 다중 모델 추론 엔드포인트를 처리하는 데 매우 적합합니다. 엔드포인트 구성에서 G7 인스턴스 유형(예: ml.g7.xlarge~ml.g7.48xlarge)을 지정하는 방법으로 SageMaker AI Inference 콘솔, API 또는 SDK를 사용하여 G7 인스턴스에 모델을 배포할 수 있습니다.

SageMaker AI inference를 위한 G7 인스턴스는 미국 동부(버지니아 북부, 오하이오) 및 미국 서부(오리건)에서 사용할 수 있습니다. 인스턴스에 대한 요금 정보는 요금 페이지를 참조하세요.