Execute workloads interativas no Amazon EMR no EC2 com o Spark Connect

Publicado: 24 de set de 2026

O Amazon EMR no EC2 agora oferece suporte a sessões interativas do Apache Spark com o Spark Connect. Engenheiros de dados e cientistas de dados podem desenvolver e depurar aplicativos Apache Spark interativamente a partir de notebooks gerenciados no Estúdio Unificado Amazon SageMaker e seus próprios IDEs, como o Jupyter e o Visual Studio Code, com cada sessão sendo executada no EMR dedicado em clusters do EC2.  

Uma sessão interativa fornece um contexto persistente do Spark que abrange células e scripts, permitindo combinar a execução local do código Python com operações remotas do Spark. A arquitetura cliente-servidor do Spark Connect desacopla o cliente da sua aplicação do driver do Spark e permite que você mantenha seu ambiente de desenvolvimento e suas ferramentas de preferência enquanto o Spark é executado no seu cluster Amazon EKS. Essa arquitetura desbloqueia fluxos de trabalho, incluindo exploração de dados ad hoc, depuração iterativa passo a passo e desenvolvimento incremental de tarefas do PySpark antes da implantação na produção. Cada sessão é executada como pods em um cluster virtual, protegida com sua função de execução do AWS Identity and Access Management (IAM) e marcada por projeto e usuário.

O Spark Connect no Amazon EMR no EKS está disponível com o EMR versão 7.14 (Apache Spark 3.5) e emr-spark-8.1.0 (Apache Spark 4.1), em todas as regiões comerciais da AWS. A experiência do Estúdio Unificado Amazon SageMaker está disponível nas regiões da AWS com suporte.

Para começar a usar, visite a documentação do Spark Connect no Amazon EMR no EKS ou o guia de conceitos básicos do Estúdio Unificado Amazon SageMaker.