Gemma-4-31B-it-assistant と Gemma-4-31B-IT-NVFP4 モデルが Amazon SageMaker JumpStart で利用可能に
Google DeepMind の Gemma-4-31B-it-assistant と NVIDIA の Gemma-4-31B-IT-NVFP4 の各モデルが Amazon SageMaker JumpStart で利用可能になり、AWS のお客様が利用できる基盤モデルの選択肢が拡充されました。これら 2 つのモデルは、フラッグシップモデルである Gemma 4 31B の高密度アーキテクチャをフル精度版と最適化済みの量子化版の両方で企業の商用ワークロードに提供するもので、高品質かつスケーラブルな AI ソリューションを AWS のインフラストラクチャにデプロイすることを可能にします。
これらのモデルは、専門的な機能によって、さまざまなエンタープライズ AI の課題に対処します。
Gemma-4-31B-it-assistant は、Google の主力である 31B 高密度モデルをアシスタント用途向けにチューニングしたバリアントであり、マルチモーダル推論、コーディング、およびエージェンティックワークフロー向けに構築されています。テキストと画像 (フレームシーケンスとしての動画を含む) の入力を受け取ってテキストを出力し、256K トークンのコンテキストウィンドウと 140 以上の言語に対応しています。オープンモデルを評価する Arena AI テキストリーダーボードでは第 3 位にランクインしており、自身の 20 倍の規模を持つ競合モデルすら凌駕しています。局所的なスライディングウィンドウアテンションと全体的なグローバルアテンションを交互に組み合わせたハイブリッドアテンション機構を備えており、自律型エージェントを構築するためのネイティブファンクションコーリング機能に対応しています。
Gemma-4-31B-IT-NVFP4 は、非常に少ないメモリ消費量で Gemma 4 31B と同等の機能を実現します。NVIDIA の ModelOpt フレームワークを用いて 4 ビット FP4 精度に量子化されており、元のモデルの品質を 97~99% 維持しながら、メモリ使用量を約 18.5 GB に削減し (ベースモデル比で 68% 削減) 、約 2.5 倍の高速推論を達成しています。NVIDIA RTX、DGX Spark、およびデータセンター向け GPU における、コスト効率と高スループットが求められる本番環境へのデプロイに最適です。
SageMaker JumpStart を使用すると、お客様は数回クリックするだけでこれらのモデルをデプロイし、特定の AI ユースケースに対応できます。
これらのモデルの使用を開始するには、SageMaker コンソールの SageMaker JumpStart モデルカタログにアクセスするか、SageMaker Python SDK を使用して AWS アカウントにモデルをデプロイしてください。SageMaker JumpStart での基盤モデルのデプロイと使用方法の詳細については、Amazon SageMaker JumpStart のドキュメントをご覧ください。