La recommandation d’inférence d’IA générative pour Amazon SageMaker est désormais disponible dans SageMaker AI Studio

Publié le: 20 août 2026

Amazon SageMaker AI propose désormais des recommandations d’inférence basées sur l’IA générative dans SageMaker AI Studio, offrant aux clients un chemin guidé, à programmation schématisée et sans programmation pour trouver la meilleure configuration d’inférence pour leur charge de travail. Cela s’appuie sur le lancement basé sur l’API en avril 2026, étendant la même infrastructure d’analyse comparative aux équipes qui préfèrent un flux de travail visuel à un accès programmatique.

Le déploiement de modèles d’IA générative en production nécessite de trouver la bonne combinaison de type d’instance, de conteneur de service et de stratégie d’optimisation. Pour bien faire les choses, il faut généralement des semaines d’analyse comparative manuelle, de réglage de la configuration et d’essais et d’erreurs, sans aucun moyen facile de savoir si la configuration finale est réellement optimale. Grâce à cette nouvelle expérience, les clients décrivent leur charge de travail et les éléments les plus importants, qu’il s’agisse de latence, de débit ou de coût, et SageMaker AI s’occupe du reste. Il compare plusieurs configurations sur une infrastructure GPU réelle à l’aide de NVIDIA AiPerf, applique des techniques alignées sur les objectifs, telles que le décodage spéculatif pour le débit ou le réglage du noyau pour la latence, et renvoie des recommandations classées et prêtes à être utilisées en production avec des données de performances mesurées. Les équipes obtiennent une configuration validée en quelques heures au lieu de plusieurs semaines, sans avoir à décider des techniques à appliquer ni de la manière de les configurer.

Grâce à cette nouvelle expérience, les clients décrivent leur charge de travail et les éléments les plus importants, qu’il s’agisse de latence, de débit ou de coût, et SageMaker AI s’occupe du reste. Il compare plusieurs configurations sur une infrastructure GPU réelle à l’aide de NVIDIA AiPerf, applique des techniques alignées sur les objectifs, telles que le décodage spéculatif pour le débit ou le réglage du noyau pour la latence, et renvoie des recommandations classées et prêtes à être utilisées en production avec des données de performances mesurées. Les équipes obtiennent une configuration validée en quelques heures au lieu de plusieurs semaines, sans avoir à décider des techniques à appliquer ni de la manière de les configurer.

Dans SageMaker AI Studio, sous Tâches, Optimisation par inférence, les clients sélectionnent un profil de cas d’utilisation (interagir, générer, résumer ou personnaliser), choisissent un objectif d’optimisation (minimiser la latence, maximiser le débit ou minimiser les coûts) et choisissent leur modèle parmi JumpStart, S3, Model Registry ou un modèle SageMaker existant. Les recommandations sont classées par TTFT, latence entre jetons, débit et coût, et peuvent être comparées visuellement avant le déploiement sur un point de terminaison SageMaker en temps réel directement depuis Studio.

Il n’y a aucun coût supplémentaire pour générer des recommandations. Les coûts de calcul standard s’appliquent aux tâches d’optimisation et aux points de terminaison provisionnés lors de l’analyse comparative. Cette fonctionnalité est disponible dans les Régions USA Est (Virginie du Nord), USA Ouest (Oregon), USA Est (Ohio), Europe (Irlande), Europe (Francfort), Asie-Pacifique (Singapour) et Asie-Pacifique (Tokyo). Pour en savoir plus, consultez l’article de blog ou la documentation.