Les modèles GLM-5.2 FP8, NVIDIA-Nemotron-Nano-12B-v2 et GLM-OCR sont désormais disponibles sur Amazon SageMaker JumpStart
Les modèles GLM-5.2 FP8 de Z.ai, Nemotron-Nano-12B-v2 de NVIDIA et les modèles GLM-OCR de Z.ai sont désormais disponibles sur Amazon SageMaker JumpStart, élargissant ainsi le portefeuille de modèles de base proposés aux clients AWS. Ces trois modèles apportent des fonctionnalités spécialisées couvrant l’ingénierie agentique à long terme, le raisonnement hybride efficace et la compréhension avancée des documents, permettant aux clients de déployer des solutions d’IA évolutives et performantes sur l’infrastructure AWS.
GLM-5.2 FP8 est optimisé pour les tâches à long terme et les flux de travail d’ingénierie agentiques tels que le cycle complet de développement logiciel, des exigences au déploiement. Il constitue une avancée substantielle en termes de capacité de tâches à long terme par rapport à son prédécesseur GLM-5.1 et, pour la première fois, fournit une fenêtre contextuelle réellement utilisable à 1 million de jetons, lui permettant de gérer le contexte d’ingénierie au niveau du projet, d’exécuter des tâches de longue durée de manière fiable, de suivre les normes d’ingénierie de manière cohérente et de réaliser des flux de développement complets en une seule tâche.
NVIDIA-Nemotron-Nano-12B-v2 excelle dans les tâches unifiées de raisonnement et de non-raisonnement avec un débit d’inférence élevé, ce qui en fait la solution idéale pour les applications d’entreprise nécessitant à la fois précision et efficacité. Il utilise une architecture hybride Mamba-2 et Transformer avec une longueur de contexte de 128 Ko, générant des traces de raisonnement avant de conclure avec des réponses finales. Sa conception compacte de paramètres 12B permet d’obtenir une précision comparable ou supérieure à celle des principaux modèles ouverts tout en offrant un débit d’inférence jusqu’à 6 fois supérieur.
Le GLM-OCR fournit une compréhension précise, rapide et complète des documents complexes du monde réel, notamment des PDF numérisés, des notes manuscrites, des articles universitaires denses contenant des formules, des tableaux à plusieurs colonnes, une documentation de code et du texte multilingue. Ce modèle multimodal à paramètre 0.9 B reconstruit la structure, les tables et les formules en fichiers Markdown, JSON ou LaTeX propres, avec une latence suffisamment faible pour les services en temps réel et les appareils périphériques, ce qui est idéal pour les flux de travail de traitement de documents et d’extraction de factures à grande échelle.
Avec SageMaker JumpStart, les clients peuvent déployer n’importe lequel de ces modèles en quelques clics pour répondre à leurs cas d’utilisation spécifiques de l’IA.
Pour commencer à utiliser ces modèles, accédez au catalogue de modèles SageMaker JumpStart dans la console SageMaker ou utilisez le kit SDK Python de SageMaker pour déployer les modèles sur votre compte AWS. Pour en savoir plus sur le déploiement et l’utilisation de modèles de base dans SageMaker JumpStart, consultez la documentation relative à Amazon SageMaker JumpStart.