Interaktive Workloads auf Amazon EMR auf EKS mit Spark Connect ausführen
Amazon EMR auf EKS unterstützt jetzt interaktive Apache Spark-Sitzungen mit Spark Connect. Dateningenieure und Datenwissenschaftler können Apache Spark-Anwendungen interaktiv von verwalteten Notebooks in Amazon SageMaker Unified Studio und eigene IDEs wie Jupyter und Visual Studio Code aus entwickeln und debuggen, wobei Spark auf den Amazon EKS-Clustern läuft, die sie bereits betreiben.
Eine interaktive Sitzung stellt einen persistenten Spark-Kontext bereit, der sich über Zellen und Skripte hinweg erstreckt. So können Sie lokale Python-Codeausführung und entfernte Spark-Operationen kombinieren. Die Client-Server-Architektur von Spark Connect entkoppelt Ihren Anwendungsclient vom Spark-Treiber und erlaubt es Ihnen, Ihre bevorzugte Entwicklungsumgebung und Ihre gewohnten Tools beizubehalten, während Spark auf Ihrem Amazon EKS-Cluster ausgeführt wird. Diese Architektur unterstützt Workflows wie Ad-hoc-Datenexploration und die inkrementelle Entwicklung von PySpark-Jobs vor deren Bereitstellung in der Produktion. Jede Sitzung wird als Pods auf einem virtuellen Cluster ausgeführt, der mit Ihrer AWS Identity and Access Management (IAM)-Ausführungsrolle gesichert und nach Projekt und Benutzer gekennzeichnet ist.
Spark Connect auf Amazon EMR auf EKS ist mit EMR-Version 7.14 (Apache Spark 3.5) und emr-spark-8.1.0 (Apache Spark 4.1) in allen kommerziellen AWS-Regionen verfügbar. Amazon SageMaker Unified Studio ist in unterstützten AWS-Regionen verfügbar.
Um loszulegen, besuchen Sie die Dokumentation zu Spark Connect auf Amazon EMR auf EKS oder den Leitfaden für die ersten Schritte mit Amazon SageMaker Unified Studio.