亚马逊AWS官方博客
AWS Glue 6.0 现已发布,价格降低 30%,并全面支持 Apache Iceberg v3
今天,我们正式发布 AWS Glue 6.0,其价格比之前的 AWS Glue 版本降低了 30%,并全面支持 Apache Iceberg v3 的各项功能。AWS Glue 6.0 基于完全现代化的运行时环境、Apache Spark 4.1、Python 3.12 和 Scala 2.13 构建,性能更强劲。
此次发布后,AWS Glue 在所有完全无服务器的托管 Spark 服务上提供了最完整的 Iceberg v3 实现,并新增了多项功能,可简化 ETL 编写流程、提升 PySpark 性能,并实现毫秒级延迟的实时流处理。
AWS Glue 6.0 的新增功能
AWS Glue 6.0 提供完整的 Apache Iceberg v3 规范,基于 Iceberg 1.11.0 构建。其主要特性是支持数据粉碎的 VARIANT 数据类型,与传统的字符串数据类型列相比,该特性能显著提升半结构化数据的查询读取性能。
借助 VARIANT 数据粉碎功能,您可以存储和查询 JSON、日志和事件数据,而无需展平模式,从而避免重复数据、自定义解析代码以及模式变更时的数据管道中断。这项功能彻底改变了团队大规模处理半结构化数据的方式。
Iceberg v3 的其他功能包括:
- 几何和地理数据类型:直接在托管 Spark 上为 GIS 分析、位置智能和地理空间数据管道启用原生空间处理。
- 纳秒级精度时间戳:支持物联网传感器数据、科学计算以及需要超越标准毫秒级精度的高频金融工作负载。
- 未知类型处理:处理具有意外或不断演变的模式的数据,而不会导致数据管道故障,从而增强对上游模式变更的弹性。
AWS Glue 6.0 还包含 Spark 4.1(现代运行时引擎)的一项重大升级:
- Spark 声明式管道:Spark 声明式管道引入了一种简化的 ETL 编写方法。数据工程师只需声明转换,指定数据格式,引擎即可自动确定执行顺序和优化方案。这降低了管道开发的复杂性,并消除了手动编排的开销。
- Arrow 原生 Python UDF 和 UDTF:AWS Glue 6.0 为 Python 用户定义函数(UDF)和用户定义表函数(UDTF)引入了 Arrow 原生执行。这消除了 Python 和 JVM 之间的序列化开销,从而提高了 PySpark 在处理复杂转换时的性能。
- 实时流式传输模式:对于无状态流式处理用例,AWS Glue 6.0 引入了实时流式传输模式,可实现个位数毫秒级的延迟。该功能基于 Spark 4.1 的实时模式构建,并针对 Glue 进行了优化执行,支持实时事件处理、低延迟数据转换管道和时间敏感数据路由。
AWS Glue 6.0 入门
使用 AWS Glue 6.0 无需更改任何 API。您可以通过 AWS 命令行界面(AWS CLI)、AWS SDK、AWS Glue Studio、Amazon SageMaker 融通式合作开发工作室以及您首选的 IDE,使用现有的 --glue-version 参数在 create-job 或 update-job API 中选择新版本。
要在 AWS Glue Studio 控制台中开始使用 AWS Glue 6.0 作业,请打开 AWS Glue 作业,然后在作业详情选项卡中选择版本 Glue 6.0 – 支持 Spark 4.1、Scala 2 和 Python 3。您可以在 AWS Glue 6.0 上创建新的 AWS Glue 作业以享受改进带来的好处,或者迁移您现有的 AWS Glue 作业。

要在 AWS Glue Studio 笔记本或通过 Jupyter Notebook 进行的交互式会话中使用 AWS Glue 6.0,请在 %glue_version 魔法命令中设置 6.0。 您还可以使用 AWS Glue Studio 上的 Spark 升级代理将现有作业升级到 Glue 6.0,或者使用现有 Glue 作业中的自动升级功能将其自动升级到 Glue 6.0。
要了解更多信息,请访问 AWS 文档中的 AWS Glue 6.0 版本详情和将 AWS Glue for Spark 作业迁移到 AWS Glue 版本 6.0。
现已推出
AWS Glue 6.0 现已在所有 AWS Glue 运行的 AWS 区域正式发布。有关区域可用性和未来路线图,请访问按区域列出的 AWS 功能。如果您想调用 API、搜索文档、查找区域可用性并查看有关此新功能的疑难解答,请尝试在首选人工智能工具中使用 AWS MCP 服务器和插件。
您需要按小时费率(按秒计)为爬网程序(发现数据)和提取、转换、加载(ETL)任务(处理和加载数据)付费。对于 AWS Glue Data Catalog,您需要为元数据的存储和访问支付简单月度费用。前 100 万个对象的存储和前 100 万次访问都是免费的。要了解更多信息,请访问 AWS Glue 定价页面。
在 AWS Glue Studio 控制台中试用,并将反馈发送至 AWS re:Post for AWS Glue 或通过常用的 AWS Support 联系方式发送反馈。
— Channy