Amazon SageMaker AI Inference prend désormais en charge les instances G7
Amazon SageMaker AI Inference prend désormais en charge les instances G7 alimentées par des GPU NVIDIA RTX PRO 4500 Blackwell Server Edition, ce qui vous permet de déployer des modèles de machine learning offrant des performances d’inférence d’IA jusqu’à 4,6 fois supérieures à celles des instances G6 de la génération précédente. Les clients qui déploient des modèles d’IA générative pour l’inférence de production ont besoin d’un débit GPU et d’une capacité de mémoire élevés pour gérer de manière rentable des modèles de moyenne à grande taille, mais les instances des générations précédentes nécessitaient souvent un surprovisionnement de modèles de calcul ou de quantification coûteux pour respecter les contraintes de mémoire.
Les instances G7 fournissent 32 Go de mémoire GPU par GPU avec des cœurs Tensor de 5e génération, jusqu’à 700 Gbit/s de réseau compatible EFA (7 fois plus par rapport aux instances G6) et jusqu’à 7,6 To de stockage SSD NVMe local pour maintenir les grands modèles à proximité du calcul. Grâce à ces fonctionnalités, les instances G7 sont parfaitement adaptées à la diffusion de modèles dans la plage de paramètres 7B à 30B, aux charges de travail de génération d’images et de vidéos et aux points de terminaison d’inférence multimodèles qui bénéficient d’une bande passante et d’un débit mémoire plus élevés. Vous pouvez déployer des modèles sur des instances G7 à l’aide de la console, de l’API ou du kit SDK SageMaker AI Inference en spécifiant les types d’instances G7 (tels que ml.g7.xlarge à ml.g7.48xlarge) dans la configuration de votre point de terminaison.
Les instances G7 pour l’inférence SageMaker AI sont disponibles dans les régions USA Est (Virginie du Nord, Ohio) et USA Ouest (Oregon). Pour en savoir plus sur la tarification de ces instances, consultez notre page de tarification.