Execute workloads interativas no Amazon EMR no EC2 com o Spark Connect
O Amazon EMR no EC2 agora oferece suporte a sessões interativas do Apache Spark com o Spark Connect. Engenheiros de dados e cientistas de dados podem desenvolver e depurar aplicativos Apache Spark interativamente a partir de notebooks gerenciados no Estúdio Unificado Amazon SageMaker e seus próprios IDEs, como o Jupyter e o Visual Studio Code, com cada sessão sendo executada no EMR dedicado em clusters do EC2. Você também pode monitorar e depurar sessões ativas e concluídas no console do EMR.
Uma sessão interativa fornece um contexto persistente do Spark que abrange células e scripts, permitindo combinar a execução local do código Python com operações remotas do Spark. Isso é habilitado pela arquitetura cliente-servidor do Spark Connect, que separa seu cliente de aplicativo do driver do Spark e permite que você mantenha seu ambiente de desenvolvimento e ferramentas preferidos enquanto a infraestrutura Spark é executada de forma independente no EMR Sem Servidor. Essa arquitetura desbloqueia fluxos de trabalho, incluindo exploração de dados ad hoc, depuração iterativa passo a passo e desenvolvimento incremental de tarefas do PySpark antes da implantação na produção. Para maior observabilidade, você obtém monitoramento de sessão em tempo real por meio da interface do usuário do Spark, rastreamento de histórico por meio do Spark History Server e gerenciamento de sessões pelo console do EMR ou API/CLI/SDK.
As sessões interativas estão disponíveis no Amazon EMR no EC2 com o AWS Runtime para Apache Spark (emr-spark-8.0) e versões posteriores, em todas as regiões da AWS onde o Amazon EMR está disponível, exceto nas regiões AWS GovCloud e na China. A experiência do Estúdio Unificado Amazon SageMaker está disponível nas regiões com suporte. Para começar a usar, visite o guia das Sessões interativas com o Spark Connect ou o guia de introdução ao Estúdio Unificado Amazon SageMaker.