Amazon SageMaker HyperPod verbessert Support für Ray

Veröffentlicht am: 24. Aug. 2026

Amazon SageMaker HyperPod erweitert jetzt die Unterstützung für Ray um integrierte Observability, belastbares Training, beschleunigte Inferenz und verwaltete Entwicklungsumgebungen. Ray ist ein beliebtes Open-Source-Framework für die Skalierung von KI-Workloads auf einer einheitlichen Rechenebene, von der Datenverarbeitung und verteiltem Training bis hin zu Reinforcement Learning und Model Serving. Die Ausführung von Ray auf Kubernetes im Produktionsmaßstab kann eine betriebliche Belastung sein: Jobs hängen, geringe GPU-Auslastung aufgrund statischer Teamzuweisungen und Einrichtung der Beobachtbarkeit in mehreren Schritten. Außerdem bedeutet das Fehlen einer interaktiven Entwicklungsumgebung, dass für jede Codeänderung eine weitere Stellenausschreibung und Vertrautheit mit kubectl erforderlich sind.

HyperPod bietet Ray jetzt eine einfachere Entwicklung, belastbares Training und beschleunigte Inferenz. Datenwissenschaftler erstellen, bearbeiten, überwachen und löschen Ray-Cluster über eine webbasierte Oberfläche in Amazon SageMaker Studio. Anschließend hängen sie JupyterLab, den Code Editor oder eine lokale IDE an einen laufenden Ray-Cluster an und iterieren interaktiv gegen Berechnungen auf Clusterebene. Ein Ray-Cluster mit mehreren Knoten verhält sich wie eine lokale Entwicklungsumgebung, sodass Sie jede Änderung sofort testen, ohne darauf warten zu müssen, dass ein neuer Job in die Warteschlange gestellt und gestartet wird. Aus Gründen der Beobachtbarkeit stellt HyperPod Grafana-Dashboards mit Metriken in Amazon Managed Service for Prometheus bereit und ermöglicht den Zugriff auf das Ray-Dashboard über einen sicheren Browser-Link mit einem Klick, sodass Sie von der ersten Ausführung an Einblick in Ihre Workloads haben. Für Schulungen im großen Maßstab sorgen die automatische Wiederherstellung von HyperPod-Knoten und die Erkennung hängender Jobs für GPU-Fehler, Jobabbrüche, Verlustspitzen und verringerten Durchsatz. Mehrstufiges Checkpointing stellt den Zustand des Cluster-Speichers wieder her, um den Goodput zu maximieren, und die Task-Governance verbessert die Rechenauslastung durch Kontingente, Prioritäten und Präemption. Zusammen sorgen sie dafür, dass Ihre langen Trainingsläufe trotz Ausfällen voranschreiten und maximieren die nützliche Arbeit, die pro GPU-Stunde geleistet wird. Zur Inferenz mit Ray Serve verwendet ein mehrstufiger KV-Cache zwischengespeicherte Präfixe wieder, um die Zeit bis zum ersten Token zu verkürzen, und Sie können Amazon SageMaker JumpStart-Modelle direkt bereitstellen.

Der Open-Source-Ray-Code läuft unverändert und Sie können entweder die speziell entwickelte Oberfläche von SageMaker Studio übernehmen oder einzelne Funktionen nutzen, um sie in Ihre eigene ML-Plattform zu integrieren.

Ray-Unterstützung ist für HyperPod-Cluster verfügbar, die von Amazon EKS orchestriert werden, in AWS-Regionen, in denen SageMaker HyperPod unterstützt wird. Weitere Informationen finden Sie in der SageMaker HyperPod-Dokumentation und in der interaktiven Demo.