Amazon SageMaker HyperPod prend désormais en charge la surveillance de l’état approfondie pour les clusters Slurm avec un provisionnement continu

Publié le: 9 juil. 2026

Amazon SageMaker HyperPod prend désormais en charge la surveillance de l’état approfondie pour les clusters orchestrés par Slurm créés avec un provisionnement continu, ce qui vous permet de vérifier de manière proactive l’état de l’accélérateur GPU sur les instances en cours d’exécution à tout moment. Le provisionnement continu vous permet de démarrer rapidement l’entraînement et de mettre à l’échelle les groupes d’instances de manière asynchrone, sans aucune défaillance. Vous pouvez désormais associer cette flexibilité à une validation complète du matériel au fur et à mesure que les instances sont mises en ligne. Cette fonctionnalité permet de relever un défi majeur : même un seul nœud défectueux peut faire perdre des heures de temps de calcul et retarder des charges de travail critiques.

Grâce à la surveillance de l’état approfondie, vous pouvez cibler des groupes d’instances entiers ou des instances spécifiques afin d’exécuter des tests de résistance matériels complets et des tests de connectivité avant d’affecter des ressources de calcul à une tâche. Étant donné que le provisionnement continu ajoute des composants master à votre cluster Slurm de manière asynchrone à mesure que la capacité devient disponible, vous pouvez effectuer une surveillance de l’état approfondie de chaque nouveau nœud au fur et à mesure de sa mise en ligne, en validant le matériel avant de planifier des tâches sur celui-ci et sans interrompre les charges de travail déjà exécutées sur des nœuds sains. Les progrès et les résultats sont visibles à la fois au niveau du groupe d’instances et de l’instance via la console SageMaker et les API, offrant une visibilité complète sur l’état du GPU, la connectivité réseau et les performances de communication multi-nœuds. Les instances soumises à des contrôles sont automatiquement isolées de la planification de la charge de travail et remises en service une fois qu’elles sont réussies. Lorsqu’elles sont associées à la fonction de restauration automatique des nœuds d’HyperPod, les instances défaillantes sont automatiquement redémarrées ou remplacées, garantissant ainsi la santé du cluster.

Cette fonctionnalité est disponible dans toutes les régions dans lesquelles Amazon SageMaker HyperPod est disponible. Pour en savoir plus sur la surveillance de l’état approfondie et le provisionnement continu, consultez le Guide de l’utilisateur d’Amazon SageMaker HyperPod.