AWS ParallelCluster 3.16 fügt Node-Diagnose-Tool hinzu
AWS ParallelCluster 3.16 ist jetzt mit einem neuen On-Node-Diagnosetool, Verbesserungen der Cluster-Stabilität und einem aktualisierten HPC- und KI/ML-Softwarestack allgemein verfügbar.
pcluster-diag ist ein in die ParallelCluster-AMIs integriertes Diagnose-Tool, mit dem Sie mit einem einzigen Befehl Diagnoseprüfungen auf jedem Cluster-Knoten durchführen und einen strukturierten Bericht erhalten, der die Identifizierung von Problemen erleichtert. Diese Version verschärft auch den Cluster-Lebenszyklus durch robustere Clustererstellung, Updates und Image-Builds. Der Software-Stack wird mit aktualisierten NVIDIA-Treiber-, CUDA-, EFA-Installer- und Slurm-Versionen aktualisiert. Informationen zum Einstieg in pcluster-diag finden Sie unter Problembehandlung mit pcluster-diag. Nähere Details finden Sie in den Versionshinweisen zu AWS ParallelCluster 3.16.0.
AWS ParallelCluster ist ein Open-Source-Tool für das Cluster-Management, das Kunden aus dem F&E-Bereich und ihren IT-Administratoren den Betrieb von HPC-Clustern (High Performance Computing) in AWS ermöglicht. ParallelCluster wurde für die automatische und sichere Bereitstellung von Cloud-Ressourcen in elastisch skalierbaren HPC-Clustern entwickelt, mit denen wissenschaftliche und technische Workloads in großem Maßstab auf AWS ausgeführt werden können. ParallelCluster ist ohne Aufpreis in den hier aufgelisteten AWS-Regionen verfügbar. Sie bezahlen nur für die AWS-Ressourcen, die zur Ausführung Ihrer Anwendungen erforderlich sind.
Weitere Informationen zum Starten von HPC-Clustern in AWS finden Sie im Benutzerhandbuch für ParallelCluster. Wenn Sie ParallelCluster verwenden möchten, lesen Sie die Installationsanweisungen für die Benutzeroberfläche und die CLI von ParallelCluster.