Amazon SageMaker HyperPod améliore la prise en charge de Ray
Amazon SageMaker HyperPod améliore désormais la prise en charge de Ray grâce à une observabilité intégrée, une formation résiliente, une inférence accélérée et des environnements de développement gérés. Ray est un cadre open source populaire, permettant de mettre à l’échelle les charges de travail d’IA sur une couche de calcul unifiée, du traitement des données à l’entraînement distribué, en passant par l’apprentissage par renforcement et le service de modèles. L’exécution de Ray sur Kubernetes à l’échelle de la production peut représenter une charge opérationnelle : blocages de tâches, faible utilisation du GPU due à l’allocation statique des équipes et configuration de l’observabilité en plusieurs étapes. De plus, l’absence d’environnement de développement interactif signifie que chaque modification de code nécessite une nouvelle soumission de tâche et une familiarité avec kubectl.
HyperPod facilite désormais le développement ainsi que la formation et accélère l’inférence pour Ray. Les scientifiques des données créent, modifient, surveillent et suppriment des clusters Ray depuis une interface Web d’Amazon SageMaker Studio, puis relient JupyterLab, un éditeur de code ou un IDE local à un cluster Ray en cours d’exécution et effectuent des itérations interactives par rapport au calcul à l’échelle du cluster. Un cluster Ray multi-nœuds se comporte comme un environnement de développement local. Vous pouvez donc tester chaque modification immédiatement, sans attendre qu’une nouvelle tâche soit mise en file d’attente et démarre. À des fins d’observabilité, HyperPod fournit des tableaux de bord Grafana avec des métriques dans Amazon Managed Service pour Prometheus et permet d’accéder en un clic au tableau de bord Ray via un lien de navigateur sécurisé, ce qui vous donne une visibilité sur vos charges de travail dès la première exécution. Pour l’entraînement à grande échelle, la restauration automatique des nœuds HyperPod et la détection des tâches bloquées gèrent les défaillances du processeur graphique, les blocages de tâches, les pics de pertes et la dégradation du débit. Le point de contrôle hiérarchisé rétablit l’état de la mémoire du cluster pour optimiser le rendement, et la gouvernance des tâches améliore l’utilisation du calcul grâce à des quotas, des priorités et une préemption. Ensemble, ils permettent à vos longues sessions d’entraînement de progresser malgré les échecs et d’optimiser le travail utile effectué par heure GPU. À des fins d’inférence avec Ray Serve, un cache KV hiérarchisé réutilise les préfixes mis en cache afin de réduire le délai d’obtention du premier jeton, et vous pouvez déployer directement les modèles Amazon SageMaker JumpStart.
Le code Ray open source reste inchangé, et vous pouvez soit adopter l’expérience spécifique de SageMaker Studio, soit intégrer des fonctionnalités individuelles à votre propre plateforme de ML.
Le support Ray est disponible pour les clusters HyperPod orchestrés par Amazon EKS, dans les Régions AWS où SageMaker HyperPod est pris en charge. Pour en savoir plus, consultez la documentation de SageMaker HyperPod et explorez la démo interactive.