AWS PCS artık özel GRES, donanım topolojisi ve MIG'yi destekliyor
AWS Paralel Bilgi İşlem Hizmeti (AWS PCS) artık özel Genel Kaynak (GRES) ayarlarını ve donanım topolojisini destekliyor ve Slurm 26.05 sürümü için destek ekliyor. Bu özellikler, Slurm'ün küme donanımınızı nasıl gördüğü ve zamanladığı üzerinde size daha ayrıntılı kontrol sağlar, HPC ve makine öğrenimi iş yükleri için görev yerleşimini iyileştirir. Ayrıca, tek bir GPU'yu Slurm'ün bağımsız olarak planladığı yalıtılmış bulut sunucularına bölen NVIDIA Multi-Instance GPU'yu (MIG) etkinleştirir.
AWS PCS, Slurm 26.05 ile donanım topolojisini varsayılan olarak yapılandırır ve her düğümün NUMA etki alanlarını Slurm yuvaları olarak ele alır. Ayrıca GPU düğümlerinde GPU çekirdek yakınlığını ve GPU'dan GPU'ya ara bağlantısını otomatik olarak algılar ve yapılandırır. Sıkı bir şekilde bağlı MPI işleri artık yuva yakınlığını kullanarak sıralama yerleşimini optimize edebilir ve GPU işleri, tahsis edilmiş GPU'larının yerel çekirdeklere düşer. Özel Slurm ve GRES ayarları, ihtiyacınız olduğunda esneklik sağlar. Ek hızlandırıcılar bildirebilir, GPU'yu MIG ile bölümlere ayırabilir, L3 önbellek etki alanlarını yuva olarak kullanabilir veya AWS PCS varsayılanlarını geçersiz kılabilirsiniz.
AWS PCS, Slurm kullanarak AWS'de yüksek performanslı bilgi işlem (HPC) iş yüklerini çalıştırmayı ve ölçeklendirmeyi kolaylaştıran yönetilen bir hizmettir. Bilgi işlem, depolama, ağ oluşturma ve görselleştirme araçlarını entegre eden eksiksiz, esnek ortamlar oluşturabilirsiniz. Siz bunları yaparken hizmet küme güncellemelerini yönetir ve yerleşik gözlemlenebilirlik sağlar.
Bu özellikler, AWS PCS'nin kullanılabildiği tüm AWS bölgelerinde kullanılabilir. Slurm 26.05, Slurm 26.05 sürüm notlarında açıklanan daha geniş zamanlama ve gözlemlenebilirlik iyileştirmelerini de getiriyor. Daha fazla bilgi edinmek için AWS PCS Kullanıcı Kılavuzu'ndaki Özel GRES ayarlarını yapılandırma, Donanım topolojisini yapılandırma ve Çoklu Bulut Sunucusu GPU'sunu (MIG) yapılandırma bölümlerine bakın.