В AWS ParallelCluster 3.16 добавлен инструмент диагностики на узле
В AWS ParallelCluster 3.16 появился общедоступный инструмент диагностики на узле, улучшена стабильность кластеров и обновлен стек программного обеспечения для высокопроизводительных вычислений, искусственного интеллекта и машинного обучения.
pcluster-diag – это инструмент диагностики, встроенный в AMI ParallelCluster. Он позволяет проводить диагностические проверки на любом узле кластера одной командой и получать структурированный отчет, чтобы легче выявлять проблемы. В этой версии также повышена надежность жизненного цикла кластера за счет более отказоустойчивого процесса создания кластера, обновлений и сборок образов. Обновлен стек программного обеспечения: обновлены драйвер NVIDIA, CUDA, установщик EFA и версии Slurm. Чтобы начать работу с pcluster-diag, см. раздел Устранение неполадок с помощью pcluster-diag. Подробнее см. в примечаниях к выпуску AWS ParallelCluster 3.16.0.
AWS ParallelCluster – это инструмент с открытым исходным кодом для управления кластерами, который позволяет заказчикам, занимающимся исследованиями и разработками, и ИТ-администраторам управлять кластерами высокопроизводительных вычислений (HPC) в AWS. AWS ParallelCluster предназначен для автоматического и безопасного выделения облачных ресурсов в эластично масштабируемые кластеры HPC, способные выполнять научные и инженерные рабочие нагрузки в любом масштабе на платформе AWS. Инструмент ParallelCluster доступен бесплатно в перечисленных здесь регионах AWS. При работе с ним вы платите только за ресурсы AWS, необходимые для запуска приложений.
Подробнее о запуске кластеров HPC в AWS см. в руководстве пользователя ParallelCluster. Чтобы начать использовать ParallelCluster, ознакомьтесь с инструкциями по установке пользовательского интерфейса и интерфейса командной строки ParallelCluster.