I broker Amazon MSK Express ora forniscono dati alle tabelle di streaming per Apache Iceberg

Inserito il: 30 lug 2026

I broker Amazon MSK Express ora forniscono dati alle tabelle di streaming per Apache Iceberg: una nuova funzionalità che materializza in modo continuo gli argomenti di Apache Kafka sotto forma di tabelle Apache Iceberg su Amazon S3 Tables. La distribuzione dei dati di Amazon MSK alle tabelle di streaming può ridurre fino al 60% i costi di acquisizione e distribuzione dei dati di Apache Kafka in Amazon S3 Tables rispetto alle implementazioni autogestite, e fino al 30% i costi delle query a valle rispetto alle implementazioni Apache Kafka autogestite.

I clienti si affidano ad Apache Kafka per l'acquisizione di dati in tempo reale in casi d'uso quali rilevamento delle frodi e personalizzazione, e con crescente frequenza puntano a unificare tali dati con le tabelle Apache Iceberg per analisi quasi in tempo reale. Tuttavia, l'integrazione dei due sistemi impone di gestire pipeline personalizzate complesse, la gestione delle conversioni di formato e fare i conti con il problema dei file di piccole dimensioni: l'acquisizione ad alto volume produce una moltitudine di piccoli file Parquet che rallentano le query a valle e fanno lievitare i costi. Con questa funzionalità, la compattazione in linea intelligente elimina l'impatto dei file di piccole dimensioni sulle prestazioni e mantiene prevedibili le prestazioni delle query senza rinunciare alla freschezza dei dati, mentre il coordinamento integrato risolve i conflitti tra scritture concorrenti provenienti da processi consumer ad alto throughput. Amazon MSK supporta un throughput fino a 10 GB/s per la distribuzione ad Apache Iceberg in Amazon S3 Tables; inoltre, poiché questa funzionalità nativa non comporta throughput di uscita aggiuntivo per i broker, i clienti evitano i costi infrastrutturali incrementali legati al dimensionamento delle pipeline basate su connettori e commisurano la capacità alla domanda effettiva anziché ai picchi. I dati distribuiti alle tabelle di streaming possono essere interrogati o trasformati con qualsiasi motore a scelta, tra cui Apache Spark, Trino o Apache Flink. 

Per iniziare, è sufficiente aprire la console Amazon MSK, selezionare il cluster Express e abilitare la funzionalità in pochi clic, oppure ricorrere alle API MSK o al server MCP. La distribuzione di dati Amazon MSK alle tabelle di streaming è ora disponibile in tutte le regioni AWS in cui sono offerti i broker Amazon MSK Express. Per informazioni sui prezzi, consulta la pagina dei prezzi. Per ulteriori informazioni, consulta la guida per sviluppatori di Amazon MSK e le competenze IA di Amazon MSK.