亚马逊AWS官方博客

Category: Artificial Intelligence

MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

本文在亚马逊云科技中国区(宁夏)使用 llama.cpp 部署 Qwen3.6 系列大语言模型(27B Dense 和 35B-A3B MoE),对比了 Graviton4 ARM CPU、Intel x86 CPU 和 NVIDIA A10G GPU 三种硬件平台上 MTP (Multi-Token Prediction) 投机解码的实际加速效果,并给出了各芯片架构下的部署最佳实践。

基于 Amazon Bedrock 的 Apache SeaTunnel AI CLI 模型评测:从配置生成到真实执行

本文以 Apache SeaTunnel AI CLI 项目为基础,通过 Amazon Bedrock 的统一模型访问层,对 7 个模型完成 100 个 ETL 任务的分层评测:不仅衡量配置生成和静态校验结果,也在真实数据环境中验证执行。实验显示,模型在静态校验阶段的表现不能直接预测其真实执行成功率。本文的目标不是给出一份通用模型排行榜,而是提供一套面向 AI 辅助 ETL 的评测与选型方法:团队应结合自身任务复杂度、运行时成功率、错误修复能力和总体成本,持续选择并验证最适合自身数据环境的模型组合。

基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优

随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。在实际项目中,如何高效地在GPU集群上部署和优化大模型推理,已经成为AI基础设施团队面临的核心挑战之一。本文基于多个实际项目的经验积累,系统性地介绍大模型推理部署的方法论、部署方案选型、性能调优以及常见问题的解决方案。

AWS DevOps Agent 实战:如何使用生成式 AI 加速故障演练

本文将通过示例介绍,如何借助 Kiro 与 AWS DevOps Agent,把原本高度依赖人力的演练,转变为低成本、可复现、并能在每次演练中自动产出调查结论的流程。读完本文,您将了解如何为每一类故障切换信号设计可靠的检测、如何运行基础演练并设计其他演练流程,以及如何把 DevOps Agent 集成到您的 on-call 流程。

星合互娱借助 AWS DevOps Agent 构建多游戏智能运维体系

面对多游戏、多账号、小团队的运维压力,星合互娱在评估多种 AI 运维方案后,最终选择了 AWS DevOps Agent。核心考量在于:DevOps Agent 并非独立于现有体系之外的另一套工具,而是能够直接融入星合互娱已有的监控、代码和云账号体系,让 AI 在现有数据上发挥价值,而非要求团队重新建设数据管道。

让 Agent拥有「跨终端长期记忆」——基于 Amazon Bedrock AgentCore Memory 的实践

无状态是 LLM 的天性,但「记不住」不该成为 Agent 的宿命。本文通过 HOOK+MCP Server 的方式,来使用 Amazon Bedrock AgentCore Memory,实现跨项目、跨终端、跨人员的团队记忆共享。记忆于是变成了一个独立的、可治理的服务层,不再跟着人、设备或某一个客户端走。本文也进一步分享了使用Amazon Bedrock AgentCore Memory的一些实操经验与技巧。