亚马逊AWS官方博客

awschina

Author: awschina

750B MoE 模型从自建 RoCE 集群迁移至 AWS EFA:Prefill-Decode 分离推理的通信架构验证

客户在自建机房使用基于 ConnectX 系列网卡的 RoCE 集群运行 GLM-5.1-FP8(750B MoE)模型推理服务,采用 Prefill-Decode (PD) 分离架构:2 台 Prefill 节点 + 2 台 Decode 节点,每台 8×H200 GPU。期望利用 AWS 弹性算力扩展本地 GPU 计算资源,同时获得更快的硬件迭代能力,从而降低硬件采购和折旧风险。AWS EFA 能否在这种极端复杂的通信负载下,达到 ConnectX 系列 + RoCE 方案的性能水平?我们基于客户的实际部署需求进行了完整的理论分析和实际验证

Mountpoint S3 与 S3 Files 在 EKS 上的实战对比

本文对比了在 EKS 上通过 Mountpoint S3 CSI 和 S3 Files + EFS CSI 两种方案访问 S3 数据的差异。Mountpoint S3 是基于 FUSE 的轻量客户端,设计目标是高吞吐而非完整 POSIX 语义;S3 Files 是 2026 年 4 月 GA 的新服务,通过 NFSv4.1+ 协议和全托管智能缓存层,首次让 S3 原生支持完整文件系统语义。
两种方案并非互斥,工作负载特征互补,在同一 EKS 集群中混合部署、按场景选型,是当前 AWS 上 S3 数据接入的最佳实践。

EC2 NAT 实例选型与部署实践

本文对比了 NAT 网关与 NAT 实例的费用结构,基于 EC2 网络带宽机制和多流流量规则,分析了中国宁夏区域(cn-northwest-1)中所有当前代实例类型的可用带宽与成本,筛选出各流量档位性价比最优的实例类型,并提供了基于 Auto Scaling Group 和 CloudFormation 的高可用一键部署方案。

从 N 台 EC2 到 Amazon EKS + Amazon S3 Files:Waylens 的 OpenClaw 多智能体平台改造

本文以车载视频 AI 与车队智能化厂商 Waylens 的真实案例为例,介绍如何把分散在多台 Amazon EC2 实例上的 OpenClaw 多智能体(multi-agent)框架,迁移到由 Amazon Elastic Kubernetes Service(Amazon EKS)+ Custom Resource Definition(CRD)+ Operator 统一管理的形态。改造前,Waylens 工程师用于调试 agent 平台的时间已经超过实际使用 agent 完成业务的时间;改造后,升级、巡检、故障恢复都由 agent 自己完成:Operator 负责 EKS 层的滚动升级与 liveness 自愈,Admin agent 负责跨 agent 的升级编排和日常运维,Admin 自身出问题时由 Rex(Backup EKS Operator)接管,多 agent 平台的日常运维交给 agent 自行处理。附 aws-samples/sample-your-opc-eks-agents 一键部署仓库。