이제 Amazon MSK Express 브로커를 통해 Apache Iceberg용 스트리밍 테이블로 데이터 전송 가능
Amazon MSK Express 브로커가 이제 Apache Iceberg용 스트리밍 테이블로 데이터를 전송합니다. 이 새로운 기능은 Apache Kafka 주제를 Amazon S3 Tables의 Apache Iceberg 테이블로 지속적으로 구체화합니다. Amazon MSK를 통한 스트리밍 테이블 데이터 전송은 셀프 매니지드 배포 대비 Apache Kafka 데이터를 Amazon S3 Tables로 수집하고 전송하는 비용을 최대 60% 절감하고, 셀프 매니지드 Apache Kafka 배포와 비교할 때 다운스트림 쿼리 비용을 최대 30% 절감할 수 있습니다.
고객은 사기 행위 탐지, 개인화 같은 사용 사례를 위해 실시간 데이터를 수집하는 데 Apache Kafka를 사용하고 있으며, 준실시간(near real-time) 분석을 위해 해당 데이터를 Apache Iceberg 테이블과 통합하려는 경우가 점점 늘고 있습니다. 그러나 두 시스템을 통합하려면 복잡한 맞춤형 파이프라인을 운영하고 형식 변환을 관리해야 하며, 대용량 수집으로 인해 여러 작은 Parquet 파일이 생성되어 다운스트림 쿼리가 느려지고 비용이 증가하는 문제(소형 파일 문제)에 대처해야 합니다. 이 기능을 통해 지능형 인라인 압축은 작은 파일로 인한 성능 저하를 제거하고 데이터 최신성을 유지하면서도 쿼리 성능을 예측 가능하게 유지하며, 내장된 조정 기능은 처리량이 높은 소비자 간의 동시 쓰기 충돌을 해결합니다. Amazon MSK는 Apache Iceberg로의 전송에 최대 10GB/s의 처리량을 Amazon S3 Tables에 지원하며, 이 기본 기능은 브로커 송신 처리량을 추가하지 않으므로 고객은 커넥터 파이프라인 확장에 따른 추가 인프라 비용을 절감하고 최대치가 아닌 실제 수요에 맞춰 용량을 조정할 수 있습니다. 고객은 스트리밍 테이블에 데이터를 제공하고 Apache Spark, Trino 또는 Apache Flink를 포함하여 원하는 엔진으로 데이터를 쿼리하거나 변환할 수 있습니다.
시작하려는 고객은 Amazon MSK 콘솔을 열고 Express 클러스터를 선택한 다음, 몇 번 클릭해 기능을 활성화하거나 MSK API 또는 MCP 서버를 사용하면 됩니다. 현재 Amazon MSK Express 브로커가 제공되는 모든 AWS 리전에서 스트리밍 테이블로 Amazon MSK 데이터를 전송할 수 있습니다. 요금 정보는 요금 페이지를 참조하세요. 자세히 알아보려면 Amazon MSK 개발자 안내서 및 Amazon MSK AI 스킬을 참조하세요.