Amazon SageMaker の生成 AI 推論レコメンデーション機能が SageMaker AI Studio で利用可能に
Amazon SageMaker AI は、SageMaker AI Studio において生成 AI 推論レコメンデーション機能の提供を開始しました。これにより、お客様はワークロードに最適な推論設定を見つけるための、ガイド付きのローコード/ノーコードなアプローチを利用できるようになります。これは 2026 年 4 月にリリースされた API ベースの機能に基づくものであり、同じベンチマークインフラストラクチャを、プログラムによるアクセスよりもビジュアルなワークフローを好むチームに向けに拡張したものです。
生成 AI モデルを本番環境にデプロイするには、インスタンスタイプ、サービングコンテナ、および最適化戦略の適切な組み合わせを見つける必要があります。これを正しく行うには、通常、数週間にわたる手動のベンチマーク、設定チューニング、試行錯誤が必要であり、最終的な設定が本当に最適かどうかを簡単に判断する方法もありませんでした。新しいエクスペリエンスでは、お客様がワークロードの概要と、最も重要な要素 (レイテンシー、スループット、またはコスト) を指定するだけで、残りの処理は SageMaker AI が実行します。NVIDIA AIPerf を使用して実際の GPU インフラストラクチャ上で複数の構成をベンチマーク測定し、スループット向上のための投機的デコーディングやレイテンシー削減のためのカーネルチューニングなど、目的に合致した手法を適用した上で、測定されたパフォーマンスデータとともに本番環境に対応したレコメンデーションをランク付けして出力します。チームは、どの手法を適用すべきかやその設定方法を自ら判断することなく、検証済みの設定に到達するまでの期間を数週間から数時間へと短縮できます。
新しいエクスペリエンスでは、お客様がワークロードの概要と、最も重要な要素 (レイテンシー、スループット、またはコスト) を指定するだけで、残りの処理は SageMaker AI が実行します。NVIDIA AIPerf を使用して実際の GPU インフラストラクチャ上で複数の構成をベンチマーク測定し、スループット向上のための投機的デコーディングやレイテンシー削減のためのカーネルチューニングなど、目的に合致した手法を適用した上で、測定されたパフォーマンスデータとともに本番環境に対応したレコメンデーションをランク付けして出力します。チームは、どの手法を適用すべきかやその設定方法を自ら判断することなく、検証済みの設定に到達するまでの期間を数週間から数時間へと短縮できます。
SageMaker AI Studio の [ジョブ] > [推論最適化] で、お客様はユースケースプロファイル (対話、生成、要約、カスタム) を選択し、最適化目標 (レイテンシーの最小化、スループットの最大化、コストの最小化) を選び、JumpStart、S3、Model Registry、または既存の SageMaker モデルからモデルを選択します。レコメンデーションは TTFT、トークン間レイテンシー、スループット、およびコストによってランク付けされ、Studio から直接 SageMaker リアルタイムエンドポイントにデプロイする前に視覚的に比較できます。
レコメンデーションの作成に追加料金は発生しません。ベンチマーク中にプロビジョニングされた最適化ジョブおよびエンドポイントには、標準のコンピューティング料金が適用されます。本機能は、米国東部 (バージニア北部)、米国西部 (オレゴン)、米国東部 (オハイオ)、欧州 (アイルランド)、欧州 (フランクフルト)、アジアパシフィック (シンガポール)、アジアパシフィック (東京) でご利用いただけます。詳細については、ブログ記事とドキュメントを参照してください。