Amazon SageMaker HyperPod, 이제 더 빠른 추론 오토 스케일링 및 콜드 스타트 감소를 위한 모델 캐싱을 지원

게시된 날짜: 2026년 9월 11일

Amazon SageMaker HyperPod는 이제 모델 가중치 및 컨테이너 이미지를 클러스터 노드에 미리 로드하는 추론 최적화인 모델 캐싱을 지원하므로 포드가 몇 분이 아닌 몇 초 만에 시작됩니다.

채팅 어시스턴트, 에이전트 파이프라인, RAG, 문서 분석과 같은 워크로드를 위해 대규모로 LLM 추론을 실행할 때 콜드 스타트는 실제로 병목 현상을 초래합니다. 배포 및 스케일 아웃 이벤트는 컨테이너 이미지 및 모델 가중치를 다운로드하는 데 대부분의 시간을 소비합니다. 모델 크기가 커질수록 상황은 더욱 악화됩니다. 대형 모델은 트래픽을 처리하기까지 수십 분이 걸립니다.

모델 캐싱은 두 가지 독립적인 기능으로 이 문제를 해결합니다. 가중치 캐시는 모델 가중치를 로컬 NVMe에 저장하므로 포드는 네트워크를 통해 S3 또는 FSx에서 가져오는 대신 빠른 로컬 스토리지에서 읽습니다. 이미지 캐시는 컨테이너 이미지를 미리 가져오므로 포드는 ECR 다운로드를 완전히 건너뛰게 됩니다. 웜 캐시가 없는 노드에 포드가 배치될 경우 자동으로 원래 소스에서 가져오는 방식으로 대체되므로 포드가 멈추거나 실패할 위험이 없습니다.

57~145GB 모델의 벤치마크에서는 약 60% 더 빠른 스케일 아웃을 보여주며 이미지 캐시는 2분 이상의 이미지 풀 시간을 단축합니다(97% 감소). 원래 소스 경로의 신뢰성을 유지하면서도 모델 크기가 커질수록 이점이 커집니다.

고객은 InferenceEndpointConfig 또는 JumpStartModel 리소스에 modelCacheConfig 섹션을 추가하여 HyperPod 추론 연산자를 통해 모델 캐싱을 활성화합니다. 작업자는 수동 설정 또는 정리 없이 전체 수명 주기를 처리합니다.

모델 캐싱은 이제 SageMaker HyperPod를 사용할 수 있는 모든 리전에서 정식 버전으로 제공됩니다. 시작하려면 SageMaker HyperPod 설명서를 참조하세요.