GLM-5.2 FP8、NVIDIA-Nemotron-Nano-12B-v2 和 GLM-OCR 模型现已在 Amazon SageMaker JumpStart 中推出

发布于: 2026年8月10日

Z.ai 的 GLM-5.2 FP8 模型、NVIDIA 的 Nemotron-Nano-12B-v2 模型以及 Z.ai 的 GLM-OCR 模型现已在 Amazon SageMaker JumpStart 中推出,为 AWS 客户提供了更丰富的基础模型选择。这三种模型带来了涵盖长周期智能体工程、高效混合推理和高级文档理解在内的专业功能,助力客户在 AWS 基础设施上部署高性能、可扩展的 AI 解决方案。

GLM-5.2 FP8 模型已针对长周期任务和智能体工程工作流进行优化,例如从需求分析到部署的全周期软件开发工作流。相较于前代 GLM-5.1 模型,该模型的长周期任务能力得到了显著提升,并且首次提供了真正可用的 100 万词元上下文窗口。这使其能够处理项目级的工程上下文,稳定执行长时间运行的任务,始终如一地遵循工程标准,并在单次任务中完成整个开发工作流。

NVIDIA-Nemotron-Nano-12B-v2 模型在统一推理与非推理任务中表现优异,且具备高推理吞吐量,非常适合需要兼顾准确性与效率的企业级应用。该模型采用 Mamba-2 与转换器的混合架构,上下文长度为 12.8 万个词元,能够在给出最终响应前先生成推理轨迹。该模型采用精简的 120 亿参数设计,准确率可媲美甚至优于主流开源模型,推理吞吐量最高可提升 6 倍。

GLM-OCR 模型可对扫描版 PDF、手写笔记、含公式的密集学术论文、多列表格、代码文档及多语言文本等复杂的真实材料,提供精准、快速且全面的文档理解能力。这款包含 9 亿参数的多模态模型可将结构、表格及公式重构为干净的 Markdown、JSON 或 LaTeX 格式,延迟时间非常短,可满足实时服务与边缘设备的需求,非常适合大规模文档处理和发票提取工作流。

借助 SageMaker JumpStart,客户只需点击几下即可部署这些模型中的任何一个,以解决其特定的人工智能使用案例。

要开始使用这些模型,请导航到 SageMaker 控制台中的 SageMaker JumpStart 模型目录,或使用 SageMaker Python SDK 将模型部署到您的 AWS 账户。有关在 SageMaker JumpStart 中部署和使用基础模型的更多信息,请参阅 Amazon SageMaker JumpStart 文档