Amazon SageMaker HyperPod 現在支援模型快取,可加快推論自動擴展並減少冷啟動
張貼日期: 2026年9月11日
Amazon SageMaker HyperPod 現在支援模型快取,這是一項推論最佳化功能,會將模型權重和容器映像預先載入叢集節點,讓 Pod 在幾秒內就能啟動,而不是花上好幾分鐘。
為聊天助理、代理式管道、RAG 和文件分析等工作負載大規模執行 LLM 推論時,冷啟動是真正的瓶頸。部署和橫向擴展事件大部分時間都花在下載容器映像和模型權重上。隨著模型大小增加,情況會更加惡化,大型模型需要數十分鐘才能開始提供流量。
模型快取透過兩項獨立功能來解決這個問題。權重快取會將模型權重存放在本機 NVMe 上,讓 Pod 從快速的本機儲存讀取,而不是透過網路從 S3 或 FSx 提取。映像快取會預先提取容器映像,讓 Pod 完全略過 ECR 下載。如果 Pod 落在沒有暖快取的節點上,它會自動改回從原始來源提取,因此不會有 Pod 卡住或失敗的風險。
橫跨 57 GB 到 145 GB 模型的基準測試顯示,橫向擴展速度約快 60%,而映像快取則省下超過兩分鐘的映像提取時間 (減少 97%)。這項優勢會隨著模型大小而增加,同時保有原始來源路徑的可靠性。
客戶可透過在 InferenceEndpointConfig 或 JumpStartModel 資源中新增 modelCacheConfig 區段,經由 HyperPod Inference Operator 啟用模型快取。此 Operator 會處理完整生命週期,不需手動設定或清理。
模型快取現已在所有提供 SageMaker HyperPod 的區域正式推出。如要開始使用,請參閱 SageMaker HyperPod 文件。