Eseguire carichi di lavoro interattivi su Amazon EMR su EC2 con Spark Connect
Amazon EMR su EC2 ora supporta le sessioni interattive di Apache Spark con Spark Connect. I data engineer e i data scientist possono sviluppare ed eseguire il debug di applicazioni Apache Spark in modo interattivo da notebook gestiti in Amazon SageMaker Unified Studio e dai propri IDE, come Jupyter e Visual Studio Code, con ogni sessione eseguita su cluster dedicati di EMR su EC2. È anche possibile monitorare ed eseguire il debug delle sessioni attive e completate nella console EMR.
Una sessione interattiva fornisce un contesto Spark persistente che si estende su celle e script, consentendo di combinare l'esecuzione di codice Python locale con le operazioni Spark remote. L'architettura client-server di Spark Connect disaccoppia il client dell'applicazione dal driver Spark e consente di mantenere l'ambiente e gli strumenti di sviluppo preferiti, mentre l'infrastruttura Spark viene eseguita sul cluster. Questa architettura supporta flussi di lavoro quali l'esplorazione dei dati ad hoc, il debug iterativo passo dopo passo e lo sviluppo incrementale dei job PySpark prima della distribuzione in produzione. Per l'osservabilità, puoi usufruire del monitoraggio delle sessioni in tempo reale tramite Spark UI, della cronologia delle attività tramite Spark History Server e della gestione delle sessioni dalla console EMR o tramite API/CLI/SDK.
Interactive Sessions è disponibile su Amazon EMR su EC2 con runtime AWS per Apache Spark (emr-spark-8.0) e versioni successive, in tutte le regioni AWS in cui è disponibile Amazon EMR, ad eccezione delle regioni AWS GovCloud e delle regioni della Cina. L'esperienza Amazon SageMaker Unified Studio è disponibile nelle regioni supportate. Per iniziare, consulta la guida Sessioni interattive con Spark Connect o la Guida introduttiva di Amazon SageMaker Unified Studio.