AWS ParallelCluster 3.16 bổ sung công cụ chẩn đoán trên nút
AWS ParallelCluster 3.16 hiện đã được cung cấp rộng rãi với công cụ chẩn đoán trên nút mới, cải tiến độ ổn định cụm và ngăn xếp phần mềm HPC và AI/ML được cập nhật.
pcluster-diag là một công cụ chẩn đoán được tích hợp trong các AMI ParallelCluster cho phép bạn chạy kiểm tra chẩn đoán trên bất kỳ nút cụm nào bằng một lệnh duy nhất và nhận được báo cáo có cấu trúc giúp xác định sự cố dễ dàng hơn. Bản phát hành này cũng củng cố vòng đời cụm với việc tạo cụm, cập nhật và xây dựng hình ảnh có khả năng phục hồi tốt hơn. Ngăn xếp phần mềm được làm mới, với trình điều khiển NVIDIA, CUDA, trình cài đặt EFA và phiên bản Slurm được cập nhật. Để bắt đầu sử dụng pcluster-diag, hãy xem Khắc phục sự cố với pcluster-diag. Để biết thêm thông tin chi tiết, hãy xem ghi chú phát hành AWS ParallelCluster 3.16.0.
AWS ParallelCluster là công cụ quản lý cụm nguồn mở cho phép khách hàng thuộc lĩnh vực Nghiên cứu và phát triển và quản trị viên CNTT vận hành các cụm điện toán hiệu năng cao (HPC) trên AWS. ParallelCluster được thiết kế để cung cấp tự động và an toàn các tài nguyên đám mây cho các cụm HPC điều chỉnh quy mô linh hoạt, có khả năng chạy khối lượng công việc khoa học và kỹ thuật ở quy mô lớn trên AWS. ParallelCluster được cung cấp mà không mất thêm phí ở các Khu vực AWS được liệt kê tại đây và bạn chỉ cần trả phí cho tài nguyên AWS cần thiết để chạy ứng dụng của mình.
Để tìm hiểu thêm về cách khởi chạy cụm HPC trên AWS, hãy truy cập Hướng dẫn sử dụng ParallelCluster. Để bắt đầu sử dụng ParallelCluster, hãy xem hướng dẫn cài đặt UI và CLI ParallelCluster.