亚马逊AWS官方博客

Amazon Bedrock 现已支持 Kimi K3

开放权重模型正在改变大规模构建和部署 AI 的成本效益。随着智能水平和效率快速提升,企业可以为每项工作负载,在能力、速度与成本之间找到适合的平衡。AWS 持续建设相关能力,致力于让企业在利用开放权重模型创新成果的同时,获得生产环境所需的可靠性和安全性。

即日起,Moonshot AI 的 Kimi K3Amazon Bedrock 上正式可用,为编程和知识工作提供了一个强大的新选择。据 Moonshot AI 介绍,Kimi K3 是其能力最强的模型,也是首个参数量达到 2.8 万亿的开放模型。它将原生视觉能力与 100 万 Token 的上下文窗口相结合,扩展效率约为 Kimi K2 的 2.5 倍。这些进展使 Kimi K3 非常适合长时间运行的编程与知识工作流,这类工作流需要在处理大型代码库、文档和图像时持续保留上下文。Kimi K3 还是 Amazon Bedrock 上首个支持显式提示词缓存的开放权重模型,可帮助您在多次模型调用中复用上下文时,降低延迟和输入成本。

Kimi K3 的推出体现了 AWS 在 Amazon Bedrock 开放权重模型领域的持续投入。自 2025 年以来,Bedrock 已新增数十款开放权重模型,提供商包括 DeepSeek、Google、MiniMax、Mistral AI、Moonshot AI、NVIDIA、OpenAI 和 Qwen。随着模型选择不断扩大,用于大规模提供这些模型服务的推理技术也在持续进步。2026 年,Bedrock 新增了对工具调用、结构化输出、推理、流式响应,以及 Responses 和 Chat Completions API 的支持。由于这些属于平台能力,无需为每个模型单独集成,新的开放权重模型在 Amazon Bedrock 上线时也能利用这些能力。

与 Amazon Bedrock 上的所有开放权重模型一样,您无需改变现有安全态势,即可采用 Kimi K3。您的数据在 AWS 数据边界内处理,不会与模型提供商共享,也不会用于训练底层模型。推理请求始终启用零数据留存机制;零运维人员访问机制则确保即使是 AWS 运维人员,也无法在推理过程中访问您的提示词和模型输出。这些保护措施让您能够放心使用开放权重模型,同时保持对数据的控制。

开始在 Amazon Bedrock 上使用 Kimi K3

要体验 Kimi K3,请打开 Amazon Bedrock 控制台,依次进入 Test(测试)> Playground(试用场),并选择 Kimi K3 作为模型。随后,您就可以测试第一个提示词。

通过编程方式调用时,您可以使用 bedrock-runtime 端点。该端点支持兼容 OpenAI 的 ResponsesChat Completions API,以及 Amazon Bedrock 的 InvokeConverse API

您可以通过跨区域推理配置文件调用 Kimi K3。对于没有区域限制的工作负载,我们建议使用全局配置文件 global.moonshotai.kimi-k3,它会将每个请求路由到全球任一受支持的 AWS 商业区域。全局跨区域推理的成本比地理区域配置文件低约 10%。美国地理区域配置文件 us.moonshotai.kimi-k3 则将处理限制在美国境内,以满足数据驻留要求。

前提条件

  1. 一个处于有效状态且具有 Amazon Bedrock 访问权限的 AWS 账户。
  2. Python 3.10 或更高版本。
  3. 具备调用模型所需的 AWS Identity and Access Management(AWS IAM)权限:bedrock:InvokeModelbedrock:InvokeModelWithResponseStreambedrock:CallWithBearerToken

下面是一个简短示例,使用 OpenAI SDK 和 Python 的 aws-bedrock-token-generator 库生成短期 Bearer 令牌,以便向 Amazon Bedrock 进行身份验证。

from aws_bedrock_token_generator import provide_token
from openai import OpenAI

region = "us-west-2"
oai_client = OpenAI(
    api_key=provide_token(region=region),
    base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
)

resp = oai_client.responses.create(
    input="What is Byte-Pair Encoding, in AI?",
    model="global.moonshotai.kimi-k3",
)
print(resp.output_text)

使用显式提示词缓存优化推理

长时间运行的编程与知识工作流通常会重复发送相对固定的上下文,例如代码库说明、工具定义或参考文档。使用显式提示词缓存时,您可以标记可复用的提示词前缀,供后续请求使用已缓存的内容。当请求与已缓存的前缀匹配时,Amazon Bedrock 可以降低响应延迟和输入 Token 成本。

在 Amazon Bedrock 上使用 Kimi K3 的缓存功能时:

  • 您可以在受支持的输入内容中添加 prompt_cache_breakpoint,准确标记可复用提示词前缀的结束位置,该前缀至少需包含 1,024 个 Token。
  • 在显式模式下,写入缓存的 Token 按较高费率计费,但随后会在缓存中保留至少 30 分钟。
  • 对于后续匹配并命中缓存的请求,命中缓存的输入 Token 按折扣费率计费,且不计入每分钟输入 Token 数配额。

使用 OpenAI Python API 时,可按以下示例配置显式缓存:

resp = oai_client.responses.create(
    model="global.moonshotai.kimi-k3",
    # Enable explicit caching mode:
    extra_body={"prompt_cache_options": {"mode": "explicit"}},
    input=[
        {
            "type": "message",
            "role": "system",
            "content": [
                {
                    "type": "input_text",
                    "text": SYSTEM_PROMPT,
                    # A long, static system prompt is a great target for caching:
                    "prompt_cache_breakpoint": {"mode": "explicit"},
                },
            ]
        },
        {
            "type": "message",
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": USER_INPUT,
                    # Multiple breakpoints can also be defined, for layered cache:
                    "prompt_cache_breakpoint": {"mode": "explicit"},
                },
            ],
        },
    ],
)
if resp.usage.input_tokens_details.cached_tokens:
    print("Hit cache!")

更多示例请参阅 Moonshot AI on AWS 示例代码仓库

Kimi K3 实践

除了直接使用 API,您还可以通过多种编程助手、个人智能体和智能体框架使用 Kimi K3。这些工具既包括专门支持 Amazon Bedrock 的工具,也包括支持兼容 OpenAI 接口的模型提供商的通用工具。

编程助手

目前有多种流行的编程智能体可供开发者选择,这里以 OpenCode 为例。OpenCode 是开源工具,不限定使用某个模型,并原生支持通过 Converse API 访问模型的 amazon-bedrock 提供方(provider)。

首先,您可以参照 OpenCode 文档,在用户级或项目级 opencode.json 配置文件中配置 amazon-bedrock 提供方。配置完成后,OpenCode 会自动发现可用的 Amazon Bedrock 模型,您可以使用 /models 命令进行选择。例如,一个最简的 ~/.config/opencode.json 文件可以如下所示:

{
    "$schema": "https://opencode.ai/config.json",
    "model": "amazon-bedrock/global.moonshotai.kimi-k3",
    "provider": {
        "amazon-bedrock": {
            "options": {
                "region": "us-west-2",
                "profile": "PLACEHOLDER-YOUR-AWS-PROFILE-NAME"
            }
        }
    }
}

设置好 Amazon Bedrock 提供方后,您就可以使用 /models 命令将模型切换为 global.moonshotai.kimi-k3,并开始构建。

Kimi K3 能够开发较为复杂的功能,也能处理长周期任务。作为入门示例,我们在下面的视频中尝试用它构建一个单文件浏览器游戏:

生产力智能体

除编程外,Hermes Agent 是一款用于提升日常工作效率的开源助手。它既可通过桌面应用或常用即时通信应用使用,也可通过终端使用,并支持深度研究、任务自动化等使用场景,Kimi K3 在这些场景中同样可以表现出色。

Hermes 文档所述,Hermes 原生支持 Amazon Bedrock 上的模型。您可以按以下步骤开始使用:

  1. 在终端中运行 hermes model
  2. 在提供方列表中向下滚动,找到“AWS Bedrock”(Hermes 将“Amazon Bedrock”误标为“AWS Bedrock”)。
  3. 如果出现提示,请选择您希望 Hermes 发送请求的源 AWS 区域。
  4. 选择默认凭证链(推荐),以使用环境中已配置的 AWS Command Line Interface(AWS CLI)凭证;或者生成一个 Amazon Bedrock API 密钥
  5. 从自动发现的模型列表中选择 Kimi K3;如果列表中没有该模型,则输入 global.moonshotai.kimi-k3 作为自定义模型名称。

如果您使用具名配置文件来管理环境中的多组 AWS 凭证,那么截至本文撰写时,您需要设置 AWS_PROFILE 环境变量,或者让 Hermes 使用默认配置文件。您也可以改用 API 密钥。关于通过 Hermes 配置文件设置 AWS 配置文件的支持进展,请关注相关的未关闭问题(issue)

设置好 Amazon Bedrock 提供方并完成模型配置后,您就可以在 Hermes 中使用 Kimi K3 运行智能体工作流。例如,在下面的短视频中,我们请智能体制定了一份个性化学习计划:

可用性

即日起,您可以通过美国地理区域(us.)和全局(global.)跨区域推理配置文件,在 Amazon Bedrock 上使用 Kimi K3。完整的受支持区域列表请参阅 Bedrock 文档,定价信息请参阅 Amazon Bedrock 定价页面。

欢迎在 Amazon Bedrock 控制台中体验 Kimi K3,或浏览 GitHub 上的 Moonshot AI on AWS 示例代码仓库

想了解 Amazon Bedrock 如何支持您的团队?欢迎联系我们,进一步交流。