Amazon SageMaker HyperPod prend désormais en charge la mise en cache des modèles pour accélérer l'inférence, l’autoscaling et réduire les démarrages à froid.

Publié le: 11 sept. 2026

Amazon SageMaker HyperPod prend désormais en charge la mise en cache des modèles, une optimisation d'inférence qui précharge les poids des modèles et les images des conteneurs sur les nœuds du cluster afin que les pods démarrent en quelques secondes au lieu de quelques minutes.

Lorsque vous exécutez l'inférence LLM à grande échelle pour des charges de travail telles que les assistants de chat, les pipelines agentiques, la RAG et l'analyse de documents, le démarrage à froid constitue un véritable goulot d'étranglement. Les déploiements et les événements de mise à l'échelle passent le plus clair de leur temps à télécharger des images de conteneurs et des pondérations de modèles. À mesure que la taille des modèles augmente, la situation s'aggrave, les grands modèles mettant des dizaines de minutes avant de pouvoir gérer le trafic.

La mise en cache des modèles permet de résoudre ce problème grâce à deux fonctionnalités indépendantes. Le cache des pondérations stocke les pondérations des modèles sur un NVMe local afin que les pods puissent lire depuis un stockage local rapide au lieu de les extraire de S3 ou FSx via le réseau. Le cache d'images extrait à l'avance l'image du conteneur, de sorte que les pods ignorent complètement le téléchargement de l'ECR. Si un pod atterrit sur un nœud sans cache chaud, il recommence à extraire automatiquement de la source d'origine ; il n'y a donc aucun risque que les pods se bloquent ou tombent en panne.

Les tests de performance sur des modèles de 57 Go à 145 Go indiquent une mise à échelle environ 60 % plus rapide, et le cache d'images réduit le temps d'extraction des images de plus de deux minutes (réduction de 97 %). L'avantage augmente avec la taille du modèle tout en conservant la fiabilité du chemin source d'origine.

Les clients activent la mise en cache des modèles via l'opérateur d'inférence HyperPod en ajoutant une section ModelCacheConfig à leur ressource InferenceEndpointConfig ou JumpStartModel. L'opérateur gère l'intégralité du cycle de vie sans configuration ni nettoyage manuels.

La mise en cache des modèles est désormais disponible dans toutes les Régions où SageMaker HyperPod est disponible. Pour commencer, consultez la documentation de SageMaker HyperPod.