Amazon SageMaker 的生成式人工智能推理建议功能现已在 SageMaker AI Studio 中推出

发布于: 2026年8月20日

Amazon SageMaker AI 现已在 SageMaker AI Studio 中引入生成式人工智能推理建议功能,为客户提供引导式、低代码、无代码路径,助其找到适配自身工作负载的最佳推理配置。这项功能依托 2026 年 4 月发布的基于 API 的版本构建,将同一基准测试基础设施扩展至偏好可视化工作流而非程序化访问的团队。

要在生产环境中部署生成式人工智能模型,需要找到合适的实例类型、服务容器和优化策略组合。为此,通常需要耗费数周时间来开展手动基准测试、配置调优与反复试错,并且难以判断最终设置是否最优。借助新体验,客户只需描述自身工作负载以及最优先考量的指标(延迟、吞吐量或成本),剩余工作便可交由 SageMaker AI 完成。此功能利用 NVIDIA AIPerf,在实际 GPU 基础设施上对多种配置进行基准测试;应用与目标匹配的技术,例如应用推测解码以提升吞吐量、执行内核调优以减少延迟,最终返回带实测性能数据、已排序且可投入生产使用的建议。团队只需花费数小时而非几周时间,即可获得经过验证的配置,而无需决定应用哪些技术或如何配置它们。

借助新体验,客户只需描述自身工作负载以及最优先考量的指标(延迟、吞吐量或成本),剩余工作便可交由 SageMaker AI 完成。此功能利用 NVIDIA AIPerf,在实际 GPU 基础设施上对多种配置进行基准测试;应用与目标匹配的技术,例如应用推测解码以提升吞吐量、执行内核调优以减少延迟,最终返回带实测性能数据、已排序且可投入生产使用的建议。团队只需花费数小时而非几周时间,即可获得经过验证的配置,而无需决定应用哪些技术或如何配置它们。

在 SageMaker AI Studio 的 Jobs - Inference optimization(作业 - 推理优化)下,客户可选择使用案例配置文件(Interact、Generate、Summarize 或 Custom),选择优化目标(最小化延迟、最大化吞吐量或最小化成本),并从 JumpStart、S3、模型注册表或现有 SageMaker 模型选取模型。建议将基于 TTFT、令牌间时延、吞吐量以及成本进行优先级排序;您可在可视化对比各项后,直接从 Studio 部署至 SageMaker 实时端点。

生成建议不会产生额外费用。优化作业以及基准测试期间预置的端点将按标准计算费用计费。此功能已在美国东部(弗吉尼亚州北部)、美国西部(俄勒冈州)、美国东部(俄亥俄州)、欧洲地区(爱尔兰)、欧洲地区(法兰克福)、亚太地区(新加坡)、亚太地区(东京)推出。要了解更多信息,请查看博客文章文档