Les courtiers Amazon MSK Express transmettent désormais des données aux tables de streaming pour Apache Iceberg
Les courtiers Amazon MSK Express transmettent désormais des données aux tables de streaming pour Apache Iceberg, une nouvelle fonctionnalité qui matérialise en permanence les sujets d’Apache Kafka sous forme de tableaux Apache Iceberg sur les tableaux Amazon S3. La transmission de données Amazon MSK vers des tables de streaming peut réduire le coût d’ingestion et de diffusion des données Apache Kafka dans les tableaux Amazon S3 jusqu’à 60 % par rapport aux déploiements autogérés, et réduit les coûts des requêtes en aval jusqu’à 30 % par rapport aux déploiements autogérés Apache Kafka.
Les clients font confiance à Apache Kafka pour ingérer des données en temps réel pour des cas d’utilisation tels que la détection des fraudes et la personnalisation. Ils souhaitent de plus en plus unifier ces données avec les tables Apache Iceberg pour des analyses en temps quasi réel, mais l’intégration des deux les oblige à exploiter des pipelines personnalisés complexes, à gérer les conversions de formats et à faire face au problème des petits fichiers, où l’ingestion de gros volumes crée de nombreux petits fichiers Parquet qui ralentissent les requêtes en aval et augmentent les coûts. Grâce à cette fonctionnalité, le compactage intelligent en ligne élimine l’impact des petits fichiers sur les performances et garantit la prévisibilité des performances des requêtes sans sacrifier la fraîcheur des données, tandis que la coordination intégrée résout les conflits d’écriture simultanés entre les utilisateurs à haut débit. Amazon MSK prend en charge un débit allant jusqu’à 10 Gbit/s pour la diffusion vers Apache Iceberg sur les tableaux Amazon S3. Comme cette fonctionnalité native n’ajoute aucun débit de sortie aux courtiers, les clients évitent les coûts d’infrastructure supplémentaires liés à la mise à l’échelle des pipelines de connecteurs et adaptent la capacité à la demande réelle plutôt qu’aux pics. Les clients transmettent des données à des tables de streaming et les interrogent ou les transforment à l’aide du moteur de leur choix, notamment Apache Spark, Trino ou Apache Flink.
Pour commencer, les clients ouvrent la console Amazon MSK, sélectionnent le cluster Express et activent la fonctionnalité en quelques clics, ou utilisent les API MSK ou le serveur MCP. La diffusion de données Amazon MSK vers des tables de streaming est disponible dès aujourd’hui dans toutes les Régions AWS où les courtiers Amazon MSK Express sont proposés. Pour en savoir plus sur les tarifs, consultez la page de tarification. Pour en savoir plus, consultez le Guide du développeur d’Amazon MSK et les compétences Amazon MSK AI.