亚马逊AWS官方博客
Amazon Bedrock 现已支持 Kimi K3
开放权重模型正在改变大规模构建和部署 AI 的成本效益。随着智能水平和效率快速提升,企业可以为每项工作负载,在能力、速度与成本之间找到适合的平衡。AWS 持续建设相关能力,致力于让企业在利用开放权重模型创新成果的同时,获得生产环境所需的可靠性和安全性。
即日起,Moonshot AI 的 Kimi K3 在 Amazon Bedrock 上正式可用,为编程和知识工作提供了一个强大的新选择。据 Moonshot AI 介绍,Kimi K3 是其能力最强的模型,也是首个参数量达到 2.8 万亿的开放模型。它将原生视觉能力与 100 万 Token 的上下文窗口相结合,扩展效率约为 Kimi K2 的 2.5 倍。这些进展使 Kimi K3 非常适合长时间运行的编程与知识工作流,这类工作流需要在处理大型代码库、文档和图像时持续保留上下文。Kimi K3 还是 Amazon Bedrock 上首个支持显式提示词缓存的开放权重模型,可帮助您在多次模型调用中复用上下文时,降低延迟和输入成本。
Kimi K3 的推出体现了 AWS 在 Amazon Bedrock 开放权重模型领域的持续投入。自 2025 年以来,Bedrock 已新增数十款开放权重模型,提供商包括 DeepSeek、Google、MiniMax、Mistral AI、Moonshot AI、NVIDIA、OpenAI 和 Qwen。随着模型选择不断扩大,用于大规模提供这些模型服务的推理技术也在持续进步。2026 年,Bedrock 新增了对工具调用、结构化输出、推理、流式响应,以及 Responses 和 Chat Completions API 的支持。由于这些属于平台能力,无需为每个模型单独集成,新的开放权重模型在 Amazon Bedrock 上线时也能利用这些能力。
与 Amazon Bedrock 上的所有开放权重模型一样,您无需改变现有安全态势,即可采用 Kimi K3。您的数据在 AWS 数据边界内处理,不会与模型提供商共享,也不会用于训练底层模型。推理请求始终启用零数据留存机制;零运维人员访问机制则确保即使是 AWS 运维人员,也无法在推理过程中访问您的提示词和模型输出。这些保护措施让您能够放心使用开放权重模型,同时保持对数据的控制。
开始在 Amazon Bedrock 上使用 Kimi K3
要体验 Kimi K3,请打开 Amazon Bedrock 控制台,依次进入 Test(测试)> Playground(试用场),并选择 Kimi K3 作为模型。随后,您就可以测试第一个提示词。
通过编程方式调用时,您可以使用 bedrock-runtime 端点。该端点支持兼容 OpenAI 的 Responses 和 Chat Completions API,以及 Amazon Bedrock 的 Invoke 和 Converse API。
您可以通过跨区域推理配置文件调用 Kimi K3。对于没有区域限制的工作负载,我们建议使用全局配置文件 global.moonshotai.kimi-k3,它会将每个请求路由到全球任一受支持的 AWS 商业区域。全局跨区域推理的成本比地理区域配置文件低约 10%。美国地理区域配置文件 us.moonshotai.kimi-k3 则将处理限制在美国境内,以满足数据驻留要求。
前提条件
- 一个处于有效状态且具有 Amazon Bedrock 访问权限的 AWS 账户。
- Python 3.10 或更高版本。
- 具备调用模型所需的 AWS Identity and Access Management(AWS IAM)权限:
bedrock:InvokeModel、bedrock:InvokeModelWithResponseStream和bedrock:CallWithBearerToken。
下面是一个简短示例,使用 OpenAI SDK 和 Python 的 aws-bedrock-token-generator 库生成短期 Bearer 令牌,以便向 Amazon Bedrock 进行身份验证。
使用显式提示词缓存优化推理
长时间运行的编程与知识工作流通常会重复发送相对固定的上下文,例如代码库说明、工具定义或参考文档。使用显式提示词缓存时,您可以标记可复用的提示词前缀,供后续请求使用已缓存的内容。当请求与已缓存的前缀匹配时,Amazon Bedrock 可以降低响应延迟和输入 Token 成本。
在 Amazon Bedrock 上使用 Kimi K3 的缓存功能时:
- 您可以在受支持的输入内容中添加
prompt_cache_breakpoint,准确标记可复用提示词前缀的结束位置,该前缀至少需包含 1,024 个 Token。 - 在显式模式下,写入缓存的 Token 按较高费率计费,但随后会在缓存中保留至少 30 分钟。
- 对于后续匹配并命中缓存的请求,命中缓存的输入 Token 按折扣费率计费,且不计入每分钟输入 Token 数配额。
使用 OpenAI Python API 时,可按以下示例配置显式缓存:
更多示例请参阅 Moonshot AI on AWS 示例代码仓库。
Kimi K3 实践
除了直接使用 API,您还可以通过多种编程助手、个人智能体和智能体框架使用 Kimi K3。这些工具既包括专门支持 Amazon Bedrock 的工具,也包括支持兼容 OpenAI 接口的模型提供商的通用工具。
编程助手
目前有多种流行的编程智能体可供开发者选择,这里以 OpenCode 为例。OpenCode 是开源工具,不限定使用某个模型,并原生支持通过 Converse API 访问模型的 amazon-bedrock 提供方(provider)。
首先,您可以参照 OpenCode 文档,在用户级或项目级 opencode.json 配置文件中配置 amazon-bedrock 提供方。配置完成后,OpenCode 会自动发现可用的 Amazon Bedrock 模型,您可以使用 /models 命令进行选择。例如,一个最简的 ~/.config/opencode.json 文件可以如下所示:
设置好 Amazon Bedrock 提供方后,您就可以使用 /models 命令将模型切换为 global.moonshotai.kimi-k3,并开始构建。
Kimi K3 能够开发较为复杂的功能,也能处理长周期任务。作为入门示例,我们在下面的视频中尝试用它构建一个单文件浏览器游戏:
生产力智能体
除编程外,Hermes Agent 是一款用于提升日常工作效率的开源助手。它既可通过桌面应用或常用即时通信应用使用,也可通过终端使用,并支持深度研究、任务自动化等使用场景,Kimi K3 在这些场景中同样可以表现出色。
如 Hermes 文档所述,Hermes 原生支持 Amazon Bedrock 上的模型。您可以按以下步骤开始使用:
- 在终端中运行
hermes model。 - 在提供方列表中向下滚动,找到“AWS Bedrock”(Hermes 将“Amazon Bedrock”误标为“AWS Bedrock”)。
- 如果出现提示,请选择您希望 Hermes 发送请求的源 AWS 区域。
- 选择默认凭证链(推荐),以使用环境中已配置的 AWS Command Line Interface(AWS CLI)凭证;或者生成一个 Amazon Bedrock API 密钥。
- 从自动发现的模型列表中选择 Kimi K3;如果列表中没有该模型,则输入
global.moonshotai.kimi-k3作为自定义模型名称。
如果您使用具名配置文件来管理环境中的多组 AWS 凭证,那么截至本文撰写时,您需要设置 AWS_PROFILE 环境变量,或者让 Hermes 使用默认配置文件。您也可以改用 API 密钥。关于通过 Hermes 配置文件设置 AWS 配置文件的支持进展,请关注相关的未关闭问题(issue)。
设置好 Amazon Bedrock 提供方并完成模型配置后,您就可以在 Hermes 中使用 Kimi K3 运行智能体工作流。例如,在下面的短视频中,我们请智能体制定了一份个性化学习计划:
可用性
即日起,您可以通过美国地理区域(us.)和全局(global.)跨区域推理配置文件,在 Amazon Bedrock 上使用 Kimi K3。完整的受支持区域列表请参阅 Bedrock 文档,定价信息请参阅 Amazon Bedrock 定价页面。
欢迎在 Amazon Bedrock 控制台中体验 Kimi K3,或浏览 GitHub 上的 Moonshot AI on AWS 示例代码仓库。
想了解 Amazon Bedrock 如何支持您的团队?欢迎联系我们,进一步交流。