Брокеры Amazon MSK Express теперь доставляют данные в потоковые таблицы для Apache Iceberg
Брокеры Amazon MSK Express теперь доставляют данные в потоковые таблицы для Apache Iceberg. Это новая возможность, которая непрерывно материализует темы Apache Kafka в виде таблиц Apache Iceberg в Таблицах Amazon S3. Доставка данных Amazon MSK в потоковые таблицы позволяет снизить стоимость приема и доставки данных Apache Kafka в таблицы Amazon S3 максимум на 60 % по сравнению с самоуправляемыми развертываниями и сократить затраты на последующие запросы максимум на 30 % по сравнению с самоуправляемыми развертываниями Apache Kafka.
Клиенты используют Apache Kafka для приема данных в реальном времени в таких сценариях, как выявление мошенничества и персонализация, и все чаще хотят объединить эти данные с таблицами Apache Iceberg для аналитики в режиме, близком к реальному времени. Однако интеграция этих данных вынуждает их организовывать сложные настраиваемые конвейеры, управлять преобразованием форматов и решать проблему со множеством небольших файлов Parquet, которые образуются при обработке больших объемов данных, замедляют обработку последующих запросов и увеличивают затраты. Интеллектуальное встроенное сжатие устраняет влияние небольших файлов на производительность и обеспечивает предсказуемую производительность выполнения запросов без ущерба для актуальности данных, а встроенная система координации устраняет конфликты, связанные с параллельной записью потребителями с высокой пропускной способностью. Amazon MSK поддерживает пропускную способность до 10 Гбит/с при доставке данных в Apache Iceberg в Таблицах Amazon S3. Поскольку эта встроенная возможность не увеличивает пропускную способность для исходящих данных брокеров, клиенты избегают дополнительных затрат на инфраструктуру в связи с масштабированием конвейеров на основе коннекторов, а скорость доставки регулируется в соответствии с фактическими потребностями, а не по пиковым показателям. Клиенты передают данные в потоковые таблицы и запрашивают или преобразуют данные с помощью любого движка на свой выбор, включая Apache Spark, Trino или Apache Flink.
Для начала клиенты открывают консоль Amazon MSK, выбирают кластер Express и активируют эту возможность несколькими щелчками мыши либо используют API MSK или сервер MCP. Доставка данных Amazon MSK в потоковые таблицы сегодня доступна во всех регионах AWS, где предлагаются брокеры Amazon MSK Express. Сведения о ценах см. на странице цен. Подробнее см. в Руководстве по Amazon MSK для разработчиков и на странице, посвященной навыкам работы с ИИ в Amazon MSK.