Gemma-4-31B-it-assistant 與 Gemma-4-31B-IT-NVFP4 模型現已在 Amazon SageMaker JumpStart 推出
Google DeepMind 的 Gemma-4-31B-it-assistant 與 NVIDIA 的 Gemma-4-31B-IT-NVFP4 模型現已在 Amazon SageMaker JumpStart 推出,進一步擴展了 AWS 客戶可運用的基礎模型組合。這兩款模型將旗艦級的 Gemma 4 31B 稠密架構帶入企業工作負載,並同時提供全精度與最佳化量化版本,讓客戶能夠在 AWS 基礎設施上部署高效能、可擴展的 AI 解決方案。
這些模型以其專精能力解決不同的企業 AI 挑戰:
Gemma-4-31B-it-assistant 專為多模態推理、程式編寫和代理式工作流程打造,是 Google 旗艦級 31B 稠密模型的助理調校版本。它能處理文字和圖片輸入 (包括以影格序列呈現的影片) 並產生文字輸出,具備 256K 字符的上下文視窗,並支援超過 140 種語言。它在 Arena AI 文字排行榜的開放模型中排名第 3 ── 表現勝過規模大上 20 倍的模型 ── 採用混合注意力機制,交錯運用本地滑動視窗與完整全域注意力,並具備原生函式呼叫功能,可建置自主代理程式。
Gemma-4-31B-IT-NVFP4 以極小的記憶體佔用,提供與 Gemma 4 31B 相同的功能。它使用 NVIDIA 的 ModelOpt 架構量化至 4 位元 FP4 精度,將記憶體用量降至約 18.5 GB (比基礎模型小 68%),並達到約 2.5 倍的推理速度,同時保留原始模型 97–99% 的品質。非常適合在 NVIDIA RTX、DGX Spark 和資料中心 GPU 上進行具成本效益、高輸送量的生產部署。
透過 SageMaker JumpStart,客戶只需點擊幾下,即可部署任何一種模型來滿足其特定 AI 使用案例。
若要開始使用這些模型,請前往 SageMaker 主控台中的 SageMaker JumpStart 模型目錄,或使用 SageMaker Python SDK 將模型部署至您的 AWS 帳戶。如需在 SageMaker JumpStart 中部署與使用基礎模型的詳細資訊,請參閱 Amazon SageMaker JumpStart 文件。