Les modèles Cosmos3-Edge, Cosmos3-Nano et Cosmos3-Super sont désormais disponibles sur Amazon SageMaker JumpStart
Les modèles Cosmos3-Edge, Cosmos3-Nano et Cosmos3-Super de NVIDIA sont désormais disponibles sur Amazon SageMaker JumpStart, élargissant ainsi le portefeuille de modèles de fondation proposés aux clients AWS. Ces trois modèles forment la famille Cosmos 3 de modèles mondiaux omnimodaux ouverts et frontaliers pour l’IA physique, permettant aux clients de créer des robots, des véhicules autonomes et une IA de vision qui perçoivent, raisonnent, planifient et agissent dans le monde physique.
Ces modèles répondent aux différents défis de l’IA physique grâce à des fonctionnalités spécialisées :
Cosmos3-Edge est conçu pour le contrôle des robots sur l’appareil et le raisonnement visuel en temps réel sur le matériel de pointe. Cet omnimodèle à 4 B paramètres (avec un raisonneur basé sur Nemotron à 2 B) fonctionne à une résolution robotisée (640 × 360), fournissant un raisonnement en temps réel et générant 32 actions par inférence à 15 Hz sur NVIDIA Jetson Thor. Il prend en charge les vidéos 256p et 480p à une cadence de 12 à 30 images par seconde, apportant des capacités d’IA physique de pointe directement aux systèmes intégrés.
Cosmos3-Nano excelle dans la génération de mondes tenant compte de la physique et dans le raisonnement physique en tant que modèle omnimodal compact à 16 B paramètres. Il traite des combinaisons de textes, d’images, de vidéos, de sons et de trajectoires d’action pour produire les résultats correspondants, permettant aux robots et aux agents d’IA de vision de raisonner en utilisant leurs connaissances préalables, leur compréhension de la physique et leur bon sens. Il prend en charge le raisonnement en chaîne de pensée sur du texte, des images et des vidéos avec des résolutions allant jusqu’à 720p.
Cosmos3-Super fournit la génération et la simulation mondiales les plus fidèles de la famille Cosmos 3 avec 64 B paramètres. Il traite et génère conjointement le langage, les images, la vidéo, le son et les séquences d’action au sein d’une architecture Mixture-of-Transformers unifiée, prenant en charge des résolutions allant jusqu’à 720p sur plusieurs rapports d’image. Idéal pour les simulations à grande échelle, la génération de données synthétiques et les flux de travail d’entraînement des politiques.
Avec SageMaker JumpStart, les clients peuvent déployer n’importe lequel de ces modèles en quelques clics pour répondre à leurs cas d’utilisation spécifiques de l’IA.
Pour commencer à utiliser ces modèles, accédez au catalogue de modèles SageMaker JumpStart dans la console SageMaker ou utilisez le kit SDK Python de SageMaker pour déployer les modèles sur votre compte AWS. Pour en savoir plus sur le déploiement et l’utilisation de modèles de base dans SageMaker JumpStart, consultez la documentation relative à Amazon SageMaker JumpStart.