Amazon MSK Express 代理现在可将数据传输至 Apache Iceberg 的流式表

发布于: 2026年7月30日

Amazon MSK Express 代理现在可将数据传输至 Apache Iceberg 的流式表,这是一项新功能,可持续将 Apache Kafka 主题转换为 Amazon S3 表类数据存储服务中的 Apache Iceberg 表。得力于 Amazon MSK 将数据传输至流式表,摄取 Apache Kafka 数据并将其传输至 Amazon S3 表类数据存储服务的成本可降低多达 60%(与自行管理的部署相比),下游查询成本可降低多达 30%(与自行管理的 Apache Kafka 部署相比)。

客户依赖 Apache Kafka 来摄取实时数据,用于欺诈检测和个性化等使用案例,而且他们越来越希望将这些数据与 Apache Iceberg 表统一起来,从而实现近乎实时的分析。但是,要整合这两者,他们必须运行复杂的自定义管道、管理格式转换,并应对小型文件问题:大量摄取会产生许多小型 Parquet 文件,这会减慢下游查询速度并增加成本。借助此功能,智能内联压缩可消除小型文件对性能的影响,使查询性能保持可预测,且不牺牲数据新鲜度;同时,内置的协调机制可解决高吞吐量使用者之间的并发写入冲突。Amazon MSK 支持高达 10GB/s 的吞吐量,用于将数据传输至 Amazon S3 表类数据存储服务中的 Apache Iceberg。由于这项原生功能不会增加代理出口吞吐量,因此客户避免了扩展连接器管道带来的增量基础设施成本,并可按实际需求而非峰值来预置容量。客户可将数据传输至流式表,并使用他们选择的任何引擎(包括 Apache Spark、Trino 或 Apache Flink)来查询或转换数据。 

要开始使用,客户需要打开 Amazon MSK 控制台,选择相应 Express 集群,然后单击几下鼠标启用该功能,或者使用 MSK API 或 MCP 服务器。目前,在提供 Amazon MSK Express 代理的所有 AWS 区域,都支持 Amazon MSK 将数据传输至流式表。有关定价信息,请访问定价页面。要了解更多信息,请参阅 Amazon MSK 开发人员指南Amazon MSK AI 技能