langcache-embed-v3-small、Mellum2-12B-A2.5B-Thinking 和 LightOnOCR-2-1B 模型现已在 Amazon SageMaker JumpStart 中推出

发布于: 2026年8月10日

Redis 的 langcache-embed-v3-small 模型、JetBrains 的 Mellum2-12B-A2.5B-Thinking 模型以及 LightOn 的 LightOnOCR-2-1B 模型现已在 Amazon SageMaker JumpStart 中推出,为 AWS 客户提供了更丰富的基础模型选择。这三种模型带来了涵盖语义缓存优化、面向代码的推理以及端到端文档 OCR 的专业功能,助力客户在 AWS 基础设施上部署高性能、可扩展的 AI 解决方案。

langcache-embed-v3-small 模型已针对 LLM 应用程序中的语义缓存进行了优化。该模型可将句子和段落映射到一个专用于识别语义等价查询的稠密向量空间中,无论措辞如何,都能实现智能缓存命中,从而减少冗余的 LLM 调用,并加快大量推理工作负载下的响应速度。

Mellum2-12B-A2.5B-Thinking 模型在代码生成、调试、多步推理和智能体编码工作流中表现出色。该模型采用混合专家架构(共 64 个专家,每个词元激活 8 个),总参数量为 25 亿,每次前向传播仅激活 120 亿参数,上下文长度为 131072 个词元。它会在给出最终响应之前发出明确的思维链推理痕迹,提供高吞吐量、低延迟的推理,非常适合路由、RAG、子智能体和私有部署。

LightOnOCR-2-1B 模型提供面相 PDF、扫描件和图片的端到端多语言文档转文本能力,无需使用脆弱的 OCR 管道。这款包含 10 亿参数的视觉语言模型可直接将页面图像转换为整洁、自然有序的文本,其性能在 OlmOCR-Bench 中达到了业界领先水平,而体积却比同类竞品小约 9 倍,速度也显著提升。

借助 SageMaker JumpStart,客户只需点击几下即可部署这些模型中的任何一个,以解决其特定的人工智能使用案例。

要开始使用这些模型,请导航到 SageMaker 控制台中的 SageMaker JumpStart 模型目录,或使用 SageMaker Python SDK 将模型部署到您的 AWS 账户。有关在 SageMaker JumpStart 中部署和使用基础模型的更多信息,请参阅 Amazon SageMaker JumpStart 文档