เรียกใช้เวิร์กโหลดแบบโต้ตอบบน Amazon EMR บน EKS ด้วย Spark Connect
ขณะนี้ Amazon EMR บน EKS รองรับเซสชัน Apache Spark แบบโต้ตอบด้วย Spark Connect แล้ว วิศวกรข้อมูลและนักวิทยาศาสตร์ข้อมูลสามารถพัฒนาและดีบักแอปพลิเคชัน Apache Spark แบบโต้ตอบจากโน้ตบุ๊กที่มีการจัดการในสตูดิโอแบบครบวงจรของ Amazon SageMaker และจาก IDE ของตนเอง เช่น Jupyter และ Visual Studio Code โดยให้ Spark ทำงานบนคลัสเตอร์ Amazon EKS ที่ใช้งานอยู่แล้ว
เซสชันแบบโต้ตอบจะมีบริบท Spark แบบคงอยู่ซึ่งครอบคลุมหลายเซลล์และหลายสคริปต์ ช่วยให้คุณสามารถผสานการเรียกใช้โค้ด Python ภายในเครื่องเข้ากับการดำเนินการ Spark จากระยะไกลได้ สถาปัตยกรรมแบบไคลเอนต์-เซิร์ฟเวอร์ของ Spark Connect แยกไคลเอนต์ของแอปพลิเคชันออกจาก Spark Driver และช่วยให้คุณสามารถใช้สภาพแวดล้อมการพัฒนาและชุดเครื่องมือที่คุณต้องการต่อไปได้ ในขณะที่ Spark ทำงานอยู่บนคลัสเตอร์ Amazon EKS ของคุณ สถาปัตยกรรมนี้รองรับเวิร์กโฟลว์ต่าง ๆ เช่น การสำรวจข้อมูลแบบเฉพาะกิจ และการพัฒนางาน PySpark แบบเพิ่มทีละส่วนก่อนนำไปใช้ในสภาพแวดล้อมการใช้งานจริง แต่ละเซสชันจะทำงานในรูปแบบพ็อดบนคลัสเตอร์เสมือน โดยได้รับการรักษาความปลอดภัยด้วยบทบาทการดำเนินการ AWS Identity and Access Management (IAM) ของคุณ และมีการระบุแท็กตามโปรเจกต์และผู้ใช้งาน
Spark Connect บน Amazon EMR บน EKS พร้อมใช้งานแล้วใน EMR รุ่น 7.14 (Apache Spark 3.5) และ emr-spark-8.1.0 (Apache Spark 4.1) ใน AWS Commercial Region ทุกแห่ง ประสบการณ์การใช้งานสตูดิโอแบบครบวงจรของ Amazon SageMaker พร้อมใช้งานใน AWS Region ที่รองรับ
หากต้องการเริ่มต้นใช้งาน โปรดไปที่เอกสารประกอบเกี่ยวกับ Spark Connect บน Amazon EMR ใน EKS หรือคู่มือเริ่มต้นใช้งานสตูดิโอแบบครบวงจรของ Amazon SageMaker