Amazon Web Services 한국 블로그
AWS Glue 6.0 출시 – Apache Iceberg v3 지원 및 30% 저렴한 가격 제공
오늘 AWS는 이전 AWS Glue 버전보다 30% 저렴한 요금으로, Apache Iceberg v3 기능을 완벽하게 지원하는 AWS Glue 6.0의 정식 출시를 발표합니다. AWS Glue 6.0은 완전히 현대화된 런타임인 Apache Spark 4.1, Python 3.12와 Scala 2.13을 기반으로 더욱 빠른 성능을 제공합니다.
이번 릴리스에서 AWS Glue는 ETL 작성을 간소화하고, PySpark 성능을 개선하며, 10밀리초 미만의 지연 시간으로 실시간 스트리밍을 지원하는 새로운 기능과 함께, 완전 서버리스 관리형 Spark 서비스 중 가장 완벽한 Iceberg v3 구현을 제공합니다.
AWS Glue 6.0의 새로운 기능
AWS Glue 6.0은 Iceberg 1.11.0을 기반으로 Apache Iceberg v3 사양을 완벽하게 지원합니다. 핵심 기능은 슈레딩을 지원하는 VARIANT 데이터 유형으로, 반정형 데이터에서 기존 문자열 데이터 유형 열보다 빠른 쿼리 읽기 성능을 제공합니다.
VARIANT 슈레딩 기능을 사용하면 스키마를 평면화하지 않고도 JSON, 로그 및 이벤트 데이터를 저장하고 쿼리할 수 있으므로, 중복된 데이터 사본과 사용자 지정 구문 분석 코드를 없애고 스키마 변경 시 파이프라인 중단을 방지할 수 있습니다. 이 기능은 팀이 반정형 데이터를 대규모로 처리하는 방식을 혁신합니다.
Iceberg v3에 추가된 기능은 다음과 같습니다.
- 지오메트리 및 지리 데이터 유형: 관리형 Spark에서 직접 GIS 분석, 위치 인텔리전스, 지리공간 데이터 파이프라인의 기본 공간 처리를 지원합니다.
- 나노초 단위의 정밀 타임스탬프: 밀리초 수준의 표준 정밀도보다 높은 정밀도가 요구되는 IoT 센서 데이터, 과학 컴퓨팅, 고주파 금융 워크로드를 지원합니다.
- 알 수 없는 유형 처리: 예상치 못하거나 변화하는 스키마가 있는 데이터를 파이프라인 장애 없이 처리하여 업스트림 스키마 변경에 대한 복원력을 제공합니다.
AWS Glue 6.0에는 현대적 런타임 엔진인 Spark 4.1의 가장 중요한 업그레이드도 포함되어 있습니다.
- Spark 선언형 파이프라인: Spark 선언형 파이프라인은 간소화된 ETL 작성 방식을 지원합니다. 데이터 엔지니어가 데이터의 형태를 지정하여 변환을 선언하면, 엔진이 실행 순서와 최적화를 자동으로 결정합니다. 따라서 파이프라인 개발의 복잡성이 줄어들고 수동으로 오케스트레이션하는 데 따른 오버헤드가 사라집니다.
- Arrow 네이티브 Python UDF 및 UDTF: AWS Glue 6.0에서는 Python 사용자 정의 함수(UDF) 및 사용자 정의 테이블 함수(UDTF)의 Arrow 네이티브 실행을 지원합니다. 따라서 Python과 JVM 간의 직렬화 작업으로 인한 오버헤드가 해소되어, 복잡한 변환 시에 PySpark 성능이 향상됩니다.
- 실시간 스트리밍 모드: 상태 비저장 스트리밍 사용 사례에서, AWS Glue 6.0은 10밀리초 미만의 지연 시간으로 실시간 스트리밍 모드를 지원합니다. Spark 4.1의 실시간 모드와 Glue에 최적화된 실행을 기반으로, 이 기능은 실시간 이벤트 처리, 지연 시간이 짧은 데이터 변환 파이프라인, 시간에 민감한 데이터 라우팅을 지원합니다.
AWS Glue 6.0 시작하기
AWS Glue 6.0을 사용하기 위해 API를 변경할 필요는 없습니다. AWS Command Line Interface(AWS CLI), AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio 및 즐겨 사용하는 IDE를 통해, create-job 또는 update-job API의 기존 --glue-version 파라미터를 사용하여 새 버전을 선택할 수 있습니다.
AWS Glue Studio 콘솔에서 AWS Glue 6.0 작업을 시작하려면 AWS Glue 작업을 열고 작업 세부 정보 탭에서 Glue 6.0 – Spark 4.1, Scala 2, Python 3 지원 버전을 선택합니다. AWS Glue 6.0에서 새 AWS Glue 작업을 생성하여 개선된 기능을 활용하거나 기존 AWS Glue 작업을 마이그레이션할 수 있습니다.

AWS Glue Studio 노트북 또는 Jupyter Notebook을 통한 대화형 세션에서 AWS Glue 6.0을 사용하려면 %glue_version 매직에 6.0을 설정합니다. 또한 AWS Glue Studio의 Spark 업그레이드 에이전트를 사용하여 기존 작업을 Glue 6.0으로 업그레이드하거나, 기존 Glue 작업의 자동 업그레이드 기능을 사용하여 Glue 6.0으로 자동 업그레이드할 수도 있습니다.
자세한 내용은 AWS 설명서에서 AWS Glue 6.0 버전 세부 정보와 AWS Glue for Spark 작업을 AWS Glue 버전 6.0으로 마이그레이션을 참조하세요.
지금 이용 가능
AWS Glue 6.0은 현재 AWS Glue가 운영되는 모든 AWS 리전에서 정식 출시되었습니다. 리전별 이용 가능 여부와 향후 로드맵은 리전별 AWS 기능을 참조하세요. API를 호출하고, 문서를 검색하고, 지역별 가용성을 확인하고, 이 새로운 기능에 대한 문제 해결을 확인하려면 선호하는 AI 도구를 사용하여 AWS MCP Server 및 플러그인을 활용하세요.
크롤러(데이터 검색) 및 추출, 전환, 적재(ETL) 작업(데이터 처리 및 로딩)에 대해 초 단위로 청구되는 시간당 요금을 지불합니다. AWS Glue 데이터 카탈로그의 경우 메타데이터 저장 및 액세스에 대해 단순히 월별 비용을 지불합니다. 저장된 처음 1백만 개의 객체는 무료이며 처음 1백만 번의 액세스도 무료입니다. 자세한 내용은 AWS Glue 요금 페이지를 참조하세요.
AWS Glue Studio 콘솔에서 사용해 보시고, AWS re:Post for AWS Glue로 피드백을 보내거나 평소 교류하는 AWS Support 담당자를 통해 피드백을 보내주세요.
— Channy