Amazon SageMaker HyperPod unterstützt jetzt tiefgreifende Zustandsprüfungen für Slurm-Cluster mit kontinuierlicher Bereitstellung

Veröffentlicht am: 9. Juli 2026

Amazon SageMaker HyperPod unterstützt jetzt tiefgreifende Zustandsprüfungen für SLURM-orchestrierte Cluster mit kontinuierlicher Bereitstellung, sodass Sie den Zustand des GPU Accelerators auf laufenden Instances jederzeit proaktiv überprüfen können. Mit kontinuierlicher Bereitstellung können Sie schnell mit dem Training beginnen und Instance-Gruppen ohne Alles-oder-Nichts-Ausfälle asynchron skalieren. Diese Flexibilität können Sie jetzt mit einer umfassenden Hardwarevalidierung kombinieren, wenn Instances online gehen. Diese Funktion löst ein kritisches Problem, bei dem selbst ein einziger fehlerhafter Knoten Stunden an Rechenzeit verschwenden und kritische Workloads verzögern kann.

Mit umfassenden Zustandsprüfungen können Sie ganze Instance-Gruppen oder bestimmte Instances ins Visier nehmen, um umfassende Hardware-Stresstests und Konnektivitätstests durchzuführen, bevor Sie Rechenressourcen für einen Job bereitstellen. Da Ihrem Slurm-Cluster durch kontinuierliche Bereitstellung asynchron Worker-Knoten hinzufügt werden, sobald Kapazität verfügbar ist, können Sie tiefgreifende Zustandsprüfungen für jeden neuen Knoten durchführen, sobald dieser online ist, und die Hardware validieren, bevor Jobs darauf geplant werden, ohne die Workloads zu unterbrechen, die bereits auf intakten Knoten laufen. Fortschritte und Ergebnisse sind sowohl auf Instance-Gruppen- als auch auf Instance-Ebene über die SageMaker-Konsole und die APIs sichtbar und bieten einen vollständigen Überblick über den GPU-Zustand, die Netzwerkkonnektivität und die Kommunikationsleistung mit mehreren Knoten. Instances, die einer Überprüfung unterzogen werden, werden automatisch von der Workload-Planung isoliert und nach Bestehen wieder in Betrieb genommen. In Kombination mit der automatischen Knoten-Wiederherstellungsfunktion von HyperPod werden ausfallende Instances automatisch neu gestartet oder ersetzt, wodurch der Cluster-Zustand sichergestellt wird.

Diese Funktion ist in allen Regionen verfügbar, in denen Amazon SageMaker HyperPod verfügbar ist. Weitere Informationen zu tiefgreifenden Zustandsprüfungen auf Abruf und kontinuierlicher Bereitstellung finden Sie im Benutzerhandbuch für Amazon SageMaker HyperPod.