เรียกใช้เวิร์กโหลดแบบโต้ตอบบน Amazon EMR บน EC2 ด้วย Spark Connect

โพสต์บน: 4 ส.ค. 2026

ขณะนี้ Amazon EMR บน EC2 รองรับเซสชัน Apache Spark แบบโต้ตอบด้วย Spark Connect แล้ว วิศวกรข้อมูลและนักวิทยาศาสตร์ข้อมูลสามารถพัฒนาและดีบักแอปพลิเคชัน Apache Spark แบบโต้ตอบจากโน้ตบุ๊กที่มีการจัดการในสตูดิโอแบบครบวงจรของ Amazon SageMaker และจาก IDE ของตนเอง เช่น Jupyter และ Visual Studio Code โดยแต่ละเซสชันจะทำงานบนคลัสเตอร์ EMR บน EC2 ที่จัดสรรไว้โดยเฉพาะ นอกจากนี้ คุณยังสามารถติดตามตรวจสอบและแก้ไขข้อบกพร่องเซสชันที่กำลังทำงานและเซสชันที่เสร็จสิ้นแล้วได้ในคอนโซล EMR

 

เซสชันแบบโต้ตอบจะมีบริบท Spark แบบคงอยู่ซึ่งครอบคลุมหลายเซลล์และหลายสคริปต์ ช่วยให้คุณสามารถผสานการเรียกใช้โค้ด Python ภายในเครื่องเข้ากับการดำเนินการ Spark จากระยะไกลได้ สถาปัตยกรรมแบบไคลเอนต์-เซิร์ฟเวอร์ของ Spark Connect แยกไคลเอนต์ของแอปพลิเคชันออกจาก Spark Driver และช่วยให้คุณสามารถใช้สภาพแวดล้อมการพัฒนาและชุดเครื่องมือที่คุณต้องการต่อไปได้ ในขณะที่โครงสร้างพื้นฐาน Spark ทำงานอยู่บนคลัสเตอร์ สถาปัตยกรรมนี้รองรับเวิร์กโฟลว์ต่าง ๆ เช่น การสำรวจข้อมูลแบบเฉพาะกิจ การดีบักแบบวนซ้ำทีละขั้นตอน และการพัฒนางาน PySpark แบบเพิ่มทีละส่วนก่อนนำไปใช้ในสภาพแวดล้อมการใช้งานจริง สำหรับข้อมูลการสังเกต คุณจะได้รับการติดตามตรวจสอบเซสชันแบบเรียลไทม์ผ่าน Spark UI, การติดตามประวัติผ่าน Spark History Server และการจัดการเซสชันจากคอนโซล EMR หรือผ่าน API/CLI/SDK

 

เซสชันแบบโต้ตอบพร้อมใช้งานบน Amazon EMR บน EC2 ที่ใช้ AWS Runtime สำหรับ Apache Spark (emr-spark-8.0) และเวอร์ชันที่ใหม่กว่า ในทุก AWS Region ที่มี Amazon EMR ให้บริการ ยกเว้นรีเจี้ยน AWS GovCloud และรีเจี้ยนจีน ประสบการณ์การใช้งานสตูดิโอแบบครบวงจรของ Amazon SageMaker พร้อมใช้งานในรีเจี้ยนที่รองรับ ในการเริ่มต้นใช้งาน โปรดไปที่คู่มือเซสชันแบบโต้ตอบด้วย Spark Connect หรือคู่มือเริ่มต้นใช้งานสตูดิโอแบบครบวงจรของ Amazon SageMaker