Amazon SageMaker 的生成式 AI 推論推薦現已在 SageMaker AI Studio 提供

張貼日期: 2026年8月20日

Amazon SageMaker AI 現在在 SageMaker AI Studio 提供生成式 AI 推論推薦,讓客戶能以引導式、低程式碼、無程式碼的方式,找出最適合其工作負載的推論組態。這項功能延伸自 2026 年 4 月推出的 API 型功能,將相同的基準測試基礎設施提供給偏好視覺化工作流程而非程式化存取的團隊。

將生成式 AI 模型部署到生產環境,需要找出執行個體類型、服務容器和最佳化策略的適當組合。通常要做好這件事,需要數週的手動基準測試、組態調校和反覆試錯,而且沒有簡便方式確認最終設定是否真正達到最佳狀態。透過全新體驗,客戶只需描述其工作負載及最重視的因素,無論是延遲、輸送量或成本,接下來交由 SageMaker AI 處理。它會使用 NVIDIA AIPerf 在真實 GPU 基礎設施上對多個組態進行基準測試,套用以目標為導向的技術,例如針對輸送量的推測解碼或針對延遲的核心調校,並傳回具備測量效能資料、依排名排列且可供生產使用的推薦。團隊可在數小時內取得經驗證的組態,而非數週,無需自行決定要套用哪些技術或如何設定。

透過全新體驗,客戶只需描述其工作負載及最重視的因素,無論是延遲、輸送量或成本,接下來交由 SageMaker AI 處理。它會使用 NVIDIA AIPerf 在真實 GPU 基礎設施上對多個組態進行基準測試,套用以目標為導向的技術,例如針對輸送量的推測解碼或針對延遲的核心調校,並傳回具備測量效能資料、依排名排列且可供生產使用的推薦。團隊可在數小時內取得經驗證的組態,而非數週,無需自行決定要套用哪些技術或如何設定。

在 SageMaker AI Studio 的 Jobs、Inference optimization 下,客戶可選取使用案例設定檔 (Interact、Generate、Summarize 或 Custom)、選擇最佳化目標 (最小化延遲、最大化輸送量或最小化成本),並從 JumpStart、S3、模型註冊庫或現有 SageMaker 模型中選取模型。推薦會依 TTFT、字符間延遲、輸送量和成本排名,您可以在從 Studio 直接部署至 SageMaker 即時端點前,以視覺化方式比較這些推薦。

產生推薦不會產生額外費用。基準測試期間佈建的最佳化工作和端點會套用標準運算費用。此功能適用於美國東部 (維吉尼亞北部)、美國西部 (奧勒岡)、美國東部 (俄亥俄)、歐洲 (愛爾蘭)、歐洲 (法蘭克福)、亞太地區 (新加坡) 和亞太地區 (東京)。若要了解詳情,請參閱部落格文章文件