亚马逊AWS官方博客

构建 Amazon ElastiCache OSS Caches 慢查询监控方案

Redis 慢查询会阻塞单线程引擎引发故障,而 CloudWatch 缺少现成的慢查询计数指标。本方案借助 ElastiCache 慢日志的 JSON 结构化能力,用 CloudWatch Logs Metric Filter 直接生成自定义指标 RedisSlowQueryCount,零代码、纯托管、可批量部署,并经告警与 SNS 实现主动监控。

AWS Glue 3.0 到 5.0 版本升级实践:中国区大规模 ETL 平台的迁移方法论

本文分享了在 AWS 中国区将近70个 AWS Glue ETL 作业从 3.0 版本升级至 5.0 版本的完整实践经验。文章涵盖升级范围评估、中国区特有的依赖管理策略、分批部署方法论、真实性能对比数据以及典型问题的排查与解决。升级后整体 DPU 消耗降低约30%,部分作业性能提升超过60%。

如何保护 EC2 实例存储(Instance Store)数据不丢失:场景分析与自动化防护实践

Amazon EC2 实例存储(Instance Store)以其极致 I/O 性能被广泛用于分布式存储和缓存场景,但其”实例中断即数据丢失”的特性常被低估。本文系统梳理了 21 种导致 Instance Store 数据丢失的场景,并提供了一套从 Stop/Terminate Protection、SCP 策略到 EventBridge + Lambda 自动化巡检的纵深防御方案(Defense in Depth),附带可直接部署的开源代码。

用 LiteLLM WebSearch Interception 集成 AWS 托管的 Amazon Bedrock AgentCore Web Search 能力

在不修改客户端、不 fork LiteLLM 源码的前提下,将 LiteLLM 的 websearch interception 搜索后端 从自建 SearXNG 替换为 Amazon Bedrock AgentCore Web Search——一项 AWS 全托管、由 Amazon 自营 web 索引在 AWS 基础设施内服务搜索查询(查询不发往第三方搜索引擎)的 Web 搜索服务。文末给出 进阶用法:将其暴露为 MCP server,使没有 AWS 凭证的客户端 (如 OpenAI Codex)也能通过一个 LiteLLM virtual key 进行调用。