Exécutez des charges de travail interactives sur Amazon EMR sur EKS avec Spark Connect
Amazon EMR sur EKS prend désormais en charge les sessions interactives Apache Spark avec Spark Connect. Les ingénieurs et les scientifiques des données peuvent développer et déboguer des applications Apache Spark de manière interactive à partir de blocs-notes gérés dans Amazon SageMaker Unified Studio et de leurs propres IDE, tels que Jupyter et Visual Studio Code, Spark s’exécutant sur les clusters Amazon EKS qu’ils exploitent déjà.
Une session interactive fournit un contexte Spark persistant qui s’étend sur plusieurs cellules et plusieurs scripts, ce qui vous permet de combiner l’exécution de code Python local avec des opérations Spark à distance. L’architecture client-serveur de Spark Connect dissocie votre client d’application du pilote Spark et vous permet de conserver votre environnement de développement et vos outils préférés tandis que l’infrastructure Spark s’exécute sur votre cluster Amazon EKS. Cette architecture prend en charge les flux de travail, notamment l’exploration ad hoc des données et le développement incrémentiel de tâches PySpark avant le déploiement en production. Chaque session s’exécute sous forme de pods sur un cluster virtuel, sécurisé par votre rôle d’exécution AWS Identity and Access Management (IAM) et balisé par projet et par utilisateur.
Spark Connect sur Amazon EMR sur EKS est disponible avec EMR version 7.14 (Apache Spark 3.5) et emr-spark-8.1.0 (Apache Spark 4.1), dans toutes les Régions AWS commerciales. L’expérience Amazon SageMaker Unified Studio est disponible dans les Régions AWS prises en charge.
Pour commencer, consultez la documentation Spark Connect sur Amazon EMR on EKS ou le Guide de démarrage d’Amazon SageMaker Unified Studio.