AWS PCS, 이제 사용자 지정 GRES, 하드웨어 토폴로지 및 MIG를 지원
AWS Parallel Computing Service(AWS PCS)는 이제 사용자 지정 일반 리소스(GRES) 설정 및 하드웨어 토폴로지를 지원하고 Slurm 버전 26.05에 대한 지원을 추가합니다. 이러한 기능을 통해 Slurm이 클러스터 하드웨어를 인식하고 스케줄링하는 방법을 세밀하게 제어할 수 있어 HPC 및 기계 학습 워크로드의 태스크 배치가 개선됩니다. 또한 단일 GPU를 Slurm이 독립적으로 스케줄링하는 격리된 인스턴스로 분할하는 NVIDIA 멀티 인스턴스 GPU(MIG)도 지원합니다.
Slurm 26.05에서 AWS PCS는 기본적으로 하드웨어 토폴로지를 구성하여 각 노드의 NUMA 도메인을 Slurm 소켓으로 취급합니다. 또한 GPU 노드의 GPU 코어 선호도 및 GPU-GPU 인터커넥트를 자동으로 감지하고 구성합니다. 긴밀하게 결합된 MPI 작업은 이제 소켓 선호도를 사용하여 순위 배치를 최적화할 수 있으며 GPU 작업은 할당된 GPU의 로컬 코어에 배치됩니다. 사용자 지정 Slurm 및 GRES 설정은 필요할 때 유연성을 더해줍니다. 추가 액셀러레이터를 선언하거나, MIG로 GPU를 파티셔닝하거나, L3 캐시 도메인을 소켓으로 사용하거나, AWS PCS 기본값을 재정의할 수 있습니다.
AWS PCS는 Slurm을 사용해 AWS에서 고성능 컴퓨팅(HPC) 워크로드의 실행 및 확장을 간소화하는 관리형 서비스입니다. 컴퓨팅, 스토리지, 네트워킹, 시각화 도구를 통합하는 완벽하고 탄력적인 환경을 구축할 수 있으며, 이 서비스는 클러스터 업데이트를 관리하고 자체 관찰성 기능을 제공합니다.
이러한 기능은 AWS PCS가 제공되는 모든 AWS 리전에서 사용할 수 있습니다. 또한 Slurm 26.05는 Slurm 26.05 릴리스 노트에 설명된 바와 같이 광범위한 스케줄링 및 관찰성 개선 사항을 제공합니다. 자세히 알아보려면 AWS PCS 사용 설명서의 사용자 지정 GRES 설정 구성, 하드웨어 토폴로지 구성, 멀티 인스턴스 GPU(MIG) 구성을 참조하세요.