O AWS ParallelCluster 3.16 adiciona uma ferramenta de diagnóstico no nó
O AWS ParallelCluster 3.16 agora está disponível ao público em geral com uma nova ferramenta de diagnóstico no nó, melhorias na estabilidade do cluster e uma pilha atualizada de software de HPC e AI/ML.
O pcluster-diag é uma ferramenta de diagnóstico incorporada às AMIs do ParallelCluster que permite executar verificações de diagnóstico em qualquer nó do cluster com um único comando e obter um relatório estruturado que facilita a identificação de problemas. Essa versão também fortalece o ciclo de vida do cluster com a criação de clusters, atualizações e compilações de imagens mais resilientes. A pilha de software é atualizada, com o driver NVIDIA atualizado, CUDA, instalador EFA e versões Slurm. Para começar a usar o pcluster-diag, consulte Solução de problemas com o pcluster-diag. Para obter mais detalhes, consulte as notas de versão do AWS ParallelCluster 3.16.0.
O AWS ParallelCluster é uma ferramenta de gerenciamento de clusters de código aberto que permite aos clientes de P&D e administradores de TI operar clusters de computação de alta performance (HPC) na AWS. O ParallelCluster foi projetado para provisionar recursos de nuvem de forma automática e segura em clusters de HPC com escalabilidade elástica, capazes de executar workloads científicas e de engenharia em grande escala na AWS. O ParallelCluster está disponível sem custo adicional nas regiões da AWS listadas aqui. Você paga somente pelos recursos da AWS necessários para executar as aplicações.
Para saber mais sobre o lançamento de clusters de HPC na AWS, acesse o Guia do usuário do ParallelCluster. Para começar a usar o ParallelCluster, consulte as instruções de instalação da interface de usuário e da CLI do ParallelCluster.