Interaktive Workloads auf Amazon EMR auf EC2 mit Spark Connect ausführen
Amazon EMR auf EC2 unterstützt jetzt interaktive Apache Spark-Sitzungen mit Spark Connect. Dateningenieure und Datenwissenschaftler können Apache Spark-Anwendungen interaktiv über verwaltete Notebooks in Amazon SageMaker Unified Studio und ihre eigenen IDEs, wie Jupyter und Visual Studio Code, erstellen und debuggen, wobei jede Sitzung auf dedizierten EMR-auf-EC2-Clustern läuft. Sie können in der EMR-Konsole auch aktive und abgeschlossene Sitzungen überwachen und debuggen.
Eine interaktive Sitzung stellt einen persistenten Spark-Kontext bereit, der sich über Zellen und Skripte hinweg erstreckt. So können Sie lokale Python-Codeausführung und entfernte Spark-Operationen kombinieren. Die Client-Server-Architektur von Spark Connect entkoppelt Ihren Anwendungsclient vom Spark-Treiber und erlaubt es Ihnen, Ihre bevorzugte Entwicklungsumgebung und Ihre gewohnten Tools beizubehalten, während die Spark-Infrastruktur auf dem Cluster ausgeführt wird. Diese Architektur unterstützt Workflows wie Ad-hoc-Datenexploration, iteratives Debugging Schritt für Schritt sowie die inkrementelle Entwicklung von PySpark-Jobs vor deren Bereitstellung in der Produktion. Für die Beobachtbarkeit stehen Ihnen eine Echtzeitüberwachung der Sitzungen über die Spark UI, die Nachverfolgung über den Spark History Server sowie die Sitzungsverwaltung über die EMR-Konsole oder per API/CLI/SDK zur Verfügung.
Interaktive Sitzungen auf Amazon EMR auf EC2 mit AWS-Runtime für Apache Spark (emr-spark-8.0) und höher sind in allen AWS-Regionen verfügbar, in denen Amazon EMR verfügbar ist, mit Ausnahme der AWS-GovCloud-Regionen und der chinesischen Regionen. Amazon SageMaker Unified Studio ist in unterstützten Regionen verfügbar. Informationen zum Einstieg finden Sie im Benutzerleitfaden für interaktive Sitzungen mit Spark Connect oder im Leitfaden für die ersten Schritte mit Amazon SageMaker Unified Studio.