Amazon MSK Express 代理现在可将数据传输至 Apache Iceberg 的流式表
Amazon MSK Express 代理现在可将数据传输至 Apache Iceberg 的流式表,这是一项新功能,可持续将 Apache Kafka 主题转换为 Amazon S3 表类数据存储服务中的 Apache Iceberg 表。得力于 Amazon MSK 将数据传输至流式表,摄取 Apache Kafka 数据并将其传输至 Amazon S3 表类数据存储服务的成本可降低多达 60%(与自行管理的部署相比),下游查询成本可降低多达 30%(与自行管理的 Apache Kafka 部署相比)。
客户依赖 Apache Kafka 来摄取实时数据,用于欺诈检测和个性化等使用案例,而且他们越来越希望将这些数据与 Apache Iceberg 表统一起来,从而实现近乎实时的分析。但是,要整合这两者,他们必须运行复杂的自定义管道、管理格式转换,并应对小型文件问题:大量摄取会产生许多小型 Parquet 文件,这会减慢下游查询速度并增加成本。借助此功能,智能内联压缩可消除小型文件对性能的影响,使查询性能保持可预测,且不牺牲数据新鲜度;同时,内置的协调机制可解决高吞吐量使用者之间的并发写入冲突。Amazon MSK 支持高达 10GB/s 的吞吐量,用于将数据传输至 Amazon S3 表类数据存储服务中的 Apache Iceberg。由于这项原生功能不会增加代理出口吞吐量,因此客户避免了扩展连接器管道带来的增量基础设施成本,并可按实际需求而非峰值来预置容量。客户可将数据传输至流式表,并使用他们选择的任何引擎(包括 Apache Spark、Trino 或 Apache Flink)来查询或转换数据。
要开始使用,客户需要打开 Amazon MSK 控制台,选择相应 Express 集群,然后单击几下鼠标启用该功能,或者使用 MSK API 或 MCP 服务器。目前,在提供 Amazon MSK Express 代理的所有 AWS 区域,都支持 Amazon MSK 将数据传输至流式表。有关定价信息,请访问定价页面。要了解更多信息,请参阅 Amazon MSK 开发人员指南和 Amazon MSK AI 技能。