Amazon MSK Express 代理程式現在會將資料傳遞至 Apache Iceberg 的串流資料表
Amazon MSK Express 代理程式現在會將資料傳遞至 Apache Iceberg 的串流資料表,這是一項全新功能,可持續將 Apache Kafka 主題實體化為 Amazon S3 Tables 上的 Apache Iceberg 資料表。與自我管理的部署相比,Amazon MSK 將資料傳遞至串流資料表的功能,最多能夠讓將 Apache Kafka 資料擷取和傳遞至 Amazon S3 Tables 的成本降低 60%,而且與自我管理的 Apache Kafka 部署相比,下游查詢成本降低高達 30%。
客戶依賴 Apache Kafka 來擷取詐騙偵測和個人化等使用案例的即時資料,並且日益希望將這些資料與 Apache Iceberg 資料表合併以實現近乎即時的分析,但是整合這兩者會迫使客戶操作複雜的自訂管道、管理格式轉換,並面對小檔案問題,而其中涉及的大量擷取會產生許多小型 parquet 檔案,從而降低下游查詢速度並增加成本。有了這項功能,智慧型內嵌壓縮就能消除小檔案所造成的效能影響,並在不犧牲資料新鮮度的情況下,讓查詢效能保持在可預測狀態,而內建協調可解決高輸送量消費者之間的並行寫入器衝突。Amazon MSK 在傳遞至 Amazon S3 Tables 的 Apache Iceberg 方面支援高達 10 GB/s 輸送量。由於此原生功能不會增加代理程式輸出輸送量,因此客戶可避免擴展連接器管道所產生的增量基礎設施成本,並將容量分配至實際需求,而非峰值需求。客戶會將資料傳遞至串流資料表,並使用自己選擇的任何引擎 (包括 Apache Spark、Trino 或 Apache Flink) 查詢或轉換資料。
若要著手使用,客戶僅需按幾下滑鼠,即可開啟 Amazon MSK 主控台、選取 Express 叢集並啟用功能,或使用 MSK API 或 MCP 伺服器。Amazon MSK 將資料傳遞至串流資料表的功能目前適用於提供 Amazon MSK Express 代理程式的每個 AWS 區域。如需定價資訊,請瀏覽定價頁面。若要進一步了解,請參閱 Amazon MSK 開發人員指南和 Amazon MSK AI 技能。