Amazon MSK Express-Broker stellen jetzt Daten in Streaming-Tabellen für Apache Iceberg bereit
Amazon MSK Express-Broker stellen jetzt Daten in Streaming-Tabellen für Apache Iceberg bereit. Diese neue Funktion materialisiert kontinuierlich Apache Kafka-Themen als Apache Iceberg-Tabellen auf Amazon S3 Tables. Durch die Bereitstellung von Amazon MSK-Daten in Streaming-Tabellen lassen sich die Kosten für die Erfassung und Bereitstellung von Apache Kafka-Daten in Amazon S3-Tabellen im Vergleich zu selbstverwalteten Bereitstellungen um bis zu 60 % senken. Die Kosten für nachgelagerte Abfragen sinken im Vergleich zu selbstverwalteten Apache Kafka-Bereitstellungen um bis zu 30 %.
Kunden nutzen Apache Kafka, um Echtzeitdaten für Anwendungsfälle wie Betrugserkennung und Personalisierung zu erfassen. Diese Daten möchten sie zunehmend mit Apache Iceberg-Tabellen vereinheitlichen, um Analysen nahezu in Echtzeit durchzuführen. Die Integration der beiden Systeme zwingt sie jedoch dazu, komplexe benutzerdefinierte Pipelines zu betreiben, Formatkonvertierungen zu verwalten und sich mit dem Small-File-Problem auseinanderzusetzen, wobei durch die Erfassung großer Datenmengen viele kleine Dateien entstehen, die nachgelagerte Anfragen verlangsamen und die Kosten erhöhen. Mit dieser Funktion werden die Leistungseinbußen durch kleine Dateien durch intelligente Inline-Komprimierung beseitigt. Sie sorgt außerdem für eine vorhersehbare Abfrageleistung, ohne die Aktualität der Daten zu beeinträchtigen. Die integrierte Koordination löst Konflikte durch gleichzeitiges Schreiben bei Verbrauchern mit hohem Durchsatz. Amazon MSK unterstützt einen Durchsatz von bis zu 10 GB/s für die Übertragung an Apache Iceberg auf Amazon S3 Tables. Da diese native Funktion keinen Broker-Austrittsdurchsatz verursacht, vermeiden Kunden die zusätzlichen Infrastrukturkosten, die durch die Skalierung von Connector-Pipelines entstehen. Zudem können sie die Kapazität an den tatsächlichen Bedarf anpassen, statt sich an Spitzenzeiten zu orientieren. Kunden stellen Daten in Streaming-Tabellen bereit und können sie mit einer Engine ihrer Wahl, einschließlich Apache Spark, Trino oder Apache Flink, abfragen oder transformieren.
Für den Einstieg müssen Kunden die Amazon MSK-Konsole öffnen, den Express-Cluster auswählen und die Funktion mit wenigen Klicks aktivieren. Alternativ können sie die MSK-APIs oder den MCP-Server verwenden. Die Datenübermittlung von Amazon MSK an Streaming-Tabellen ist ab sofort in allen AWS-Regionen verfügbar, in denen Amazon MSK Express-Broker angeboten werden. Preisinformationen finden Sie auf der Preisseite. Weitere Informationen finden Sie im Amazon MSK-Entwicklerhandbuch und in den Amazon MSK KI-Skills.