AWS PCS がカスタム GRES、ハードウェアトポロジー、MIG をサポート
AWS Parallel Computing Service (AWS PCS) では、カスタム汎用リソース (GRES) 設定とハードウェアトポロジーに対応し、新たに Slurm バージョン 26.05 をサポートしました。これらの機能により、Slurm がクラスターハードウェアをどのように認識し、スケジューリングするかをより細かく制御できます。その結果、HPC ワークロードや機械学習ワークロードのタスク配置が改善されます。また、NVIDIA マルチインスタンス GPU (MIG) も利用できます。MIG は 1 基の GPU を分離されたインスタンスに分割し、Slurm はそれぞれのインスタンスを個別にスケジューリングします。
Slurm 26.05 では、AWS PCS がデフォルトでハードウェアトポロジーを設定し、各ノードの NUMA ドメインを Slurm ソケットとして扱います。また、GPU ノードでは GPU コアアフィニティと GPU 間の相互接続を自動検出して設定します。密結合の MPI ジョブでは、ソケットアフィニティを使用してランク配置を最適化できるようになりました。また、GPU ジョブは割り当てられた GPU と同じローカル領域にあるコアで実行されます。Slurm と GRES のカスタム設定を使用すれば、必要に応じて構成を柔軟に調整できます。追加のアクセラレーターの宣言、MIG による GPU の分割、ソケットとしての L3 キャッシュドメインの使用、AWS PCS のデフォルトの上書きが可能です。
AWS PCS は、Slurm を使用して AWS でのハイパフォーマンスコンピューティング (HPC) ワークロードの実行とスケーリングを簡素化するマネージドサービスです。コンピューティング、ストレージ、ネットワーク、可視化ツールを統合した完全で伸縮自在な環境を構築でき、サービス側がクラスターの更新を管理し、組み込みのオブザーバビリティを提供します。
これらの機能は、AWS PCS が提供されているすべての AWS リージョンで利用できます。Slurm 26.05 では、スケジューリングとオブザーバビリティに関するより広範な改善も行われています。詳細は Slurm 26.05 のリリースノートに記載されています。詳細については、AWS PCS ユーザーガイドのカスタム GRES 設定の構成、ハードウェアトポロジーの構成、およびマルチインスタンス GPU (MIG) の構成を参照してください。