Amazon SageMaker용 생성형 AI 추론 추천, 이제 SageMaker AI Studio에서 사용 가능

게시된 날짜: 2026년 8월 20일

Amazon SageMaker AI가 SageMaker AI Studio에서 생성형 AI 추론 추천을 제공합니다. 이제 고객이 워크로드에 가장 적합한 추론 구성을 찾을 수 있도록 안내하는 로코드 또는 노코드 경로를 제공합니다. 2026년 4월에 출시된 API 기반 기능을 기반으로 하며, 프로그래밍 방식 액세스보다 시각적 워크플로를 선호하는 팀을 대상으로 동일한 벤치마킹 인프라를 확장한 것입니다.

프로덕션 환경에 생성형 AI 모델을 배포하려면 인스턴스 유형, 서비스 컨테이너, 최적화 전략의 적절한 조합을 찾아야 합니다. 제대로 구현하려면 일반적으로 몇 주에 걸친 수동 벤치마킹, 구성 미세 조정과 시행착오가 필요하며, 최종 설정이 실제로 최적인지 쉽게 알 수 있는 방법이 없습니다. 새로 출시된 환경에서 고객이 현재 워크로드와 함께 지연 시간, 처리량 또는 비용 등 가장 중요한 요소를 설명하면 SageMaker AI가 나머지를 처리합니다. NVIDIA AIPerf를 사용하여 실제 GPU 인프라에서 여러 구성을 벤치마킹하고, 처리량을 고려한 추측성 디코딩이나 지연 시간을 고려한 커널 미세 조정과 같은 목표 지향적 기법을 적용하며, 측정된 성능 데이터와 함께 순위가 매겨진 프로덕션용 추천을 제공합니다. 팀은 적용할 기법이나 구성 방법을 결정할 필요 없이 몇 주가 아닌 몇 시간 만에 구성을 검증할 수 있습니다.

새로 출시된 환경에서 고객이 현재 워크로드와 함께 지연 시간, 처리량 또는 비용 등 가장 중요한 요소를 설명하면 SageMaker AI가 나머지를 처리합니다. NVIDIA AIPerf를 사용하여 실제 GPU 인프라에서 여러 구성을 벤치마킹하고, 처리량을 고려한 추측성 디코딩이나 지연 시간을 고려한 커널 미세 조정과 같은 목표 지향적 기법을 적용하며, 측정된 성능 데이터와 함께 순위가 매겨진 프로덕션용 추천을 제공합니다. 팀은 적용할 기법이나 구성 방법을 결정할 필요 없이 몇 주가 아닌 몇 시간 만에 구성을 검증할 수 있습니다.

고객은 SageMaker AI Studio의 Jobs > Inference optimization에서 사용 사례 프로필(Interact, Generate, Summarize 또는 Custom)을 선택하고, 최적화 목표(지연 시간 최소화, 처리량 최대화 또는 비용 최소화)를 지정한 다음, JumpStart, S3, Model Registry 또는 기존 SageMaker 모델 중에서 모델을 고릅니다. 추천은 TTFT, 토큰 간 지연 시간, 처리량, 비용을 기준으로 순위가 매겨지며, Studio에서 바로 SageMaker 실시간 엔드포인트에 배포하기 전에 시각적으로 비교할 수 있습니다.

추천 생성에는 추가 비용이 들지 않습니다. 벤치마킹 중 프로비저닝된 최적화 작업 및 엔드포인트에는 표준 컴퓨팅 비용이 적용됩니다. 이 기능은 미국 동부(버지니아 북부), 미국 서부(오리건), 미국 동부(오하이오), 유럽(아일랜드), 유럽(프랑크푸르트), 아시아 태평양(싱가포르), 아시아 태평양(도쿄)에서 사용할 수 있습니다. 자세한 내용은 블로그 게시물 또는 설명서를 참조하세요.