Inferensi Amazon SageMaker AI kini mendukung instans G7
Inferensi Amazon SageMaker AI kini mendukung instans G7 yang ditenagai oleh GPU NVIDIA RTX PRO 4500 Blackwell Server Edition, memungkinkan Anda untuk menerapkan model machine learning dengan performa inferensi AI hingga 4,6 kali lebih tinggi dibandingkan instans G6 generasi sebelumnya. Pelanggan yang menerapkan model AI generatif untuk inferensi produksi membutuhkan throughput GPU dan kapasitas memori yang tinggi untuk melayani model berukuran sedang hingga besar secara hemat biaya, tetapi instans generasi sebelumnya sering kali memerlukan penyediaan terlalu tinggi dan berlebihan untuk komputasi atau kuantisasi model agar sesuai dengan batasan memori.
Instans G7 menyediakan memori GPU 32 GB per GPU dengan Tensor Core Generasi ke-5, jaringan berkemampuan EFA hingga 700 Gbps (7x dibandingkan dengan G6), dan penyimpanan SSD NVMe lokal hingga 7,6 TB untuk menyimpan model besar agar tetap dekat dengan komputasi. Kemampuan ini menjadikan instans G7 sangat cocok untuk melayani model dalam rentang parameter 7B–30B, beban kerja pembuatan gambar dan video, serta titik akhir inferensi multi-model yang mendapat manfaat dari bandwidth memori dan throughput yang lebih tinggi. Anda dapat menerapkan model pada instans G7 menggunakan konsol, API, atau SDK SageMaker AI Inference dengan menentukan tipe instans G7 (seperti ml.g7.xlarge hingga ml.g7.48xlarge) dalam konfigurasi titik akhir Anda.
Instans G7 untuk inferensi AI SageMaker tersedia di AS Timur (Virginia Utara, Ohio) dan AS Barat (Oregon). Untuk informasi harga tentang instans ini, silakan kunjungi halaman harga kami.