AWS PCS 現在支援自訂 GRES、硬體拓撲和 MIG

張貼日期: 2026年9月11日

AWS Parallel Computing Service (AWS PCS) 現在支援自訂一般資源 (GRES) 設定和硬體拓撲,並新增對 Slurm 26.05 版的支援。這些功能可讓您更精細地控制 Slurm 查看和排程叢集硬體的方式,進而改善 HPC 和機器學習工作負載的任務配置。這些功能也支援 NVIDIA 多執行個體 GPU (MIG),可將單一 GPU 分割成多個隔離的執行個體,並由 Slurm 獨立排程。

在 Slurm 26.05 中,AWS PCS 預設會設定硬體拓撲,將每個節點的 NUMA 網域視為 Slurm 通訊端。此外,在 GPU 節點上,系統也會自動偵測並設定 GPU 核心親和性及 GPU 對 GPU 互連。緊密耦合的 MPI 作業現在可以使用插槽親和性來最佳化等級配置,而 GPU 作業則會落在其分配 GPU 的本機核心上。自訂 Slurm 和 GRES 設定可在您需要時提供靈活性。您可以宣告其他加速器、使用 MIG 分割 GPU、將 L3 快取網域用作插槽,或覆寫 AWS PCS 預設值。

AWS PCS 是一種受管服務,可使用 Slurm 在 AWS 上簡化高效能運算 (HPC) 工作負載的執行和擴展作業。您能夠建置整合運算、儲存空間、網路和視覺化工具的完整彈性環境,並且服務會管理叢集更新並提供內建的可觀測性。

這些功能適用於所有提供 AWS PCS 的 AWS 區域。Slurm 26.05 也帶來更廣泛的排程與可觀測性改進,相關說明請參閱 Slurm 26.05 版本備註。若要進一步瞭解,請參閱 AWS PCS 使用者指南中的設定自訂 GRES 設定、設定硬體拓撲和設定多執行個體 GPU (MIG)。