Chạy khối lượng công việc tương tác trong Amazon EMR trên EC2 với Spark Connect

Ngày đăng: 4 Th08 2026

Amazon EMR trên EC2 hiện hỗ trợ các phiên Apache Spark tương tác với Spark Connect. Các kỹ sư dữ liệu và nhà khoa học dữ liệu có thể phát triển và gỡ lỗi ứng dụng Apache Spark theo cách tương tác từ sổ tay được quản lý trong Studio hợp nhất của Amazon SageMaker và các IDE của riêng họ, chẳng hạn như Jupyter và Visual Studio Code, với mỗi phiên chạy trên EMR chuyên dụng trên các cụm EC2. Bạn cũng có thể giám sát và gỡ lỗi các phiên đang hoạt động và đã hoàn thành trong bảng điều khiển EMR.

 

Phiên tương tác cung cấp ngữ cảnh Spark được duy trì liên tục, trải dài trên nhiều ô và tập lệnh, tạo điều kiện cho bạn kết hợp việc thực thi mã Python cục bộ với thao tác Spark từ xa. Kiến trúc máy khách-máy chủ của Spark Connect tách máy khách ứng dụng của bạn khỏi trình điều khiển Spark và cho phép bạn duy trì môi trường và công cụ phát triển yêu thích của mình trong khi cơ sở hạ tầng Spark chạy trên cụm. Kiến trúc này hỗ trợ các quy trình công việc bao gồm khám phá dữ liệu tùy biến, gỡ lỗi từng bước lặp lại và phát triển từng phần công việc PySpark trước khi triển khai vào môi trường sản xuất. Đối với khả năng quan sát, bạn có được khả năng giám sát phiên theo thời gian thực thông qua giao diện người dùng Spark, theo dõi lịch sử thông qua Spark History Server và quản lý phiên từ bảng điều khiển EMR hoặc API/CLI/SDK.

 

Phiên tương tác được cung cấp trong Amazon EMR trên EC2 với thời gian hoạt động AWS dành cho Apache Spark (emr-spark-8.0) trở lên, ở tất cả các Khu vực AWS có sẵn Amazon EMR, ngoại trừ Khu vực AWS GovCloud và Khu vực Trung Quốc. Trải nghiệm Studio hợp nhất của Amazon SageMaker có sẵn ở các khu vực được hỗ trợ. Để bắt đầu, hãy truy cập hướng dẫn Phiên tương tác với Spark Connect hoặc hướng dẫn Bắt đầu sử dụng Studio hợp nhất của Amazon SageMaker.