Eseguire carichi di lavoro interattivi su Amazon EMR su EKS con Spark Connect
Amazon EMR su EKS ora supporta le sessioni interattive di Apache Spark con Spark Connect. I data engineer e i data scientist possono sviluppare ed eseguire il debug di applicazioni Apache Spark in modo interattivo da notebook gestiti in Amazon SageMaker Unified Studio e dai propri IDE, come Jupyter e Visual Studio Code, con Spark eseguito sui cluster Amazon EKS che già gestiscono.
Una sessione interattiva fornisce un contesto Spark persistente che si estende su celle e script, consentendo di combinare l'esecuzione di codice Python locale con le operazioni Spark remote. L'architettura client-server di Spark Connect disaccoppia il client dell'applicazione dal driver Spark e consente di mantenere l'ambiente e gli strumenti di sviluppo preferiti, mentre Spark viene eseguito sul cluster Amazon EKS. Questa architettura supporta flussi di lavoro quali l'esplorazione dei dati ad hoc e lo sviluppo incrementale dei job PySpark prima della distribuzione in produzione. Ogni sessione viene eseguita come pod su un cluster virtuale, protetta con il tuo ruolo di esecuzione di AWS Identity and Access Management (IAM) e contrassegnata con tag per progetto e utente.
Spark Connect su Amazon EMR on EKS è disponibile con la versione EMR 7.14 (Apache Spark 3.5) e emr-spark-8.1.0 (Apache Spark 4.1), in tutte le regioni commerciali AWS. L'esperienza con Amazon SageMaker Unified Studio è disponibile nelle regioni AWS supportate.
Per iniziare, visita la documentazione di Spark Connect su Amazon EMR on EKS o la guida introduttiva di Amazon SageMaker Unified Studio.